不讲原理术语,只讲你用得上的部分:大模型在做的其实只有一件事,由此推出它的四个硬限制和一条判断标准——什么活该交给它,什么活它根本干不了
大模型(LLM)是一个只会做一件事的程序:根据前面的文字,预测下一个字该是什么。它的知识停在训练截止那天、会一本正经地编、自己不能动你电脑里的任何东西、默认也不记得你上次说过什么。判断标准只有一条——这件事能不能靠「读懂文字 + 生成文字」完成,能,就交给它;不能,就得给它接上工具(那叫 Agent 工具)。
ChatGPT、DeepSeek、Claude、Kimi、豆包——你多半已经用过其中一两个了。你发一段话,它回一段话,看起来无所不知。
但用着用着就会撞上几件怪事:
这些都不是 bug,而是大模型这个东西本来就长这样。
这一篇不讲神经网络、不讲参数量,只讲一件事:它到底在干什么,以及由此决定的——什么活能交给它,什么活它根本干不了。
这是整条学习路径的第一课,后面所有的名词(上下文、Skill、MCP、Agent)都建立在这一篇上。
大模型的全称是大语言模型,英文 Large Language Model,简称 LLM。你在中文语境里听到的「大模型」,基本都是指它。
它被造出来的时候,被训练去完成一个非常单调的任务:给它一段文字,让它猜下一个字(准确说是下一个 token)最可能是什么。
举个例子,看到「今天天气真」,它会算出后面接「好」的概率最高,于是输出「好」;然后把「今天天气真好」再读一遍,继续猜下一个字。就这样一个字一个字往外蹦,蹦出你看到的整段回答。

它是怎么学会猜的?训练的时候它读了海量的文本——网页、书、论坛、代码。读得足够多之后,文字之间的规律就被它学到了:什么问题后面通常跟什么答案,什么代码前面通常有什么注释。
所以它不是在「查资料」,也不是在「思考对错」,它是在生成最像正确答案的那段文字。
这一句话是本篇的地基。下面四个限制,全都是从这句话直接推出来的。
训练是一次性的工程:把海量文本喂给它,跑很久,得到一个模型。这批文本收集到哪一天,它的知识就停在哪一天,这个时间点叫知识截止日期(training cutoff)。
所以:
那为什么有时候它又能说出很新的事? 因为很多产品在模型外面接了联网搜索:你提问 → 产品先去搜 → 把搜到的网页内容一起塞给模型 → 模型基于这些内容回答。
这时候答对的功劳不在模型的记忆,而在于有人把新资料喂给了它。这也是后面所有工具(Skill、MCP、Agent)的共同思路:模型本身不变,变的是你给它什么材料、给它什么能力。

判断方法:涉及时效的问题(价格、版本号、政策、新闻),默认不要信它的记忆,要么让它联网查,要么你把资料贴给它。
这件事有个正式名字,叫幻觉(hallucination)——模型生成了事实上错误、或者和你给的资料对不上的内容。
原因还是那句话:它在生成最像正确答案的文字,不是在查表。所以一个不存在的论文标题、一个不存在的函数名、一个编出来的链接,在「像不像」这个维度上得分很高,它就写出来了。而且语气一样自信,看不出破绽。

这不是某个厂商的模型有问题,Anthropic 在自己的官方文档里写得很直接:即便是最先进的模型也会出现幻觉。官方给的三个应对办法,你直接就能用:
| 做法 | 具体怎么说 |
|---|---|
| 允许它说不知道 | 在你的要求后面加一句「如果资料里没有,就直接说没有,不要猜」 |
| 让它先引用原文 | 处理长文档时,先让它把相关原文摘出来,再基于摘出来的内容回答 |
| 让它标出处 | 每个结论后面标明依据哪一段,找不到依据的结论就删掉 |
再加一条你自己的习惯:凡是数字、人名、版本号、法规条款、链接,一律当成「待核实」,自己点开看一眼。
这不是不信任 AI,而是知道它的工作方式之后的正常操作。
这一条是最多人误解的,也是下一篇的引子。
一个纯粹的大模型,唯一能做的事情就是输出文字。 你在聊天框里跟它说:
它没有手,没有眼睛,也没有你电脑的权限。它甚至不知道你的电脑存在。
那为什么你看到有人说「我让 AI 把这批文件整理好了」?因为他用的不是聊天框里的模型,而是一个在模型外面装了工具的程序:这个程序把「读文件」「写文件」「运行命令」这些动作包装成模型可以调用的工具,模型说「我要读这个文件」,程序真的去读,再把结果给它。

这类程序就叫 Agent 工具——下一篇 1.2 专门讲它,那也是整个网站最重要的一篇。
记住这个分界:模型负责想和说,工具负责做。
还有一个每天都会碰到的现象:新开一个对话,它就完全不认识你了。
原因是模型本身不存任何东西。每一次你按下回车,都是一次独立的请求:把这一轮需要它看到的全部文字打包发过去,它读完、回一段、然后什么都不留。
那为什么同一个对话里它记得上文?因为聊天软件替你做了一件事:每次都把之前的对话记录重新一起发过去。你看到的是「它记得」,实际发生的是「它每次都被重新告知一遍」。

这也解释了另外两个现象:
这个「一次能看到多少文字」的额度,就是上下文窗口,也是第 2 段里专门要讲的概念(2.2)。
想让它稳定记住你的偏好和项目背景,靠的不是它的记忆力,而是把这些东西写进一份文件,每次自动带上——这是后面 4.3「如何给 AI 建立长期记忆」的主题。
说完四个限制,也要说清楚它真正厉害的地方,不然容易走到另一个极端。
凡是读懂文字、生成文字就能完成的事,它做得又快又稳:
| 类型 | 具体的活 |
|---|---|
| 改写 | 把口语整理成书面语、把长句拆短、换个语气重写 |
| 压缩 | 总结长文、从会议记录里挑出待办 |
| 转换 | 翻译、把一段文字整理成表格、把要求整理成清单 |
| 分类判断 | 给一堆反馈打标签、判断这条消息属于哪一类 |
| 起草 | 写初稿:方案、周报、邮件、文案、代码 |
| 解释 | 把一段代码、一份合同、一个报错讲成人话 |
一条判断标准:这件事,如果一个聪明但对你的具体情况一无所知的人,只靠读你给的文字就能完成,那它多半也能完成;如果需要「去查最新的」「去点某个按钮」「去改某个文件」,那就超出模型本身的能力了,需要给它接工具。
注意后半句的「对你的具体情况一无所知」——你给的材料够不够,直接决定它答得好不好。这就是为什么第 4 段整段都在讲怎么给材料。
回到最开始那句话:它在根据前面的文字,预测下一个字。 四个限制全从这里来。
| 现象 | 真实原因 | 你该怎么办 |
|---|---|---|
| 说不出最近发生的事 | 知识停在训练截止那天 | 让它联网查,或者你把资料贴给它 |
| 一本正经地编 | 它生成的是「最像对的文字」 | 允许它说不知道、让它引用原文、自己核实关键信息 |
| 只给方法不动手 | 模型只能输出文字 | 换 Agent 工具(下一篇) |
| 新开对话就不认识你 | 模型不存东西,历史靠每次重发 | 把长期信息写成文件带上(4.3) |
大模型不是一个什么都懂的专家,它是一个语言能力极强、但对你一无所知、也动不了手的助手。 接下来两件事决定你能用它做多少:给它什么材料(第 2、4 段),以及给它什么能力(下一篇 1.2)。
不是。AI 是一个很大的范围,人脸识别、推荐算法、语音转文字都算 AI。大模型(LLM)特指这两年火起来的这类处理文字的模型,你在 ChatGPT、DeepSeek、Claude 里对话的就是它。
因为产品在模型外面接了联网搜索:先去搜,再把搜到的内容和你的问题一起交给模型。答对靠的是那份新资料,不是模型的记忆。所以同一个模型,在有联网的产品里和在纯 API 里表现会不一样。
不一定,而且对你来说这个数字基本没有决策价值。真正影响你使用体验的是:这一代模型的整体能力、上下文窗口多大、响应快不快、多少钱。怎么按任务选模型,看 2.6「Token 与模型选择」。
取决于你用的产品和账号类型,各家的数据使用政策不同,企业版通常承诺不用于训练。习惯上:涉密材料、身份证号、密钥这类东西不要往对话框里贴,本地跑的模型或公司内部部署是更稳妥的选择。