← 返回大模型到底是什么:它会什么、不会什么
1 / 8
Tutorial·8

大模型到底是什么:它会什么、不会什么

不讲原理术语,只讲你用得上的部分:大模型在做的其实只有一件事,由此推出它的四个硬限制和一条判断标准——什么活该交给它,什么活它根本干不了

TL;DR · 一句话结论

大模型(LLM)是一个只会做一件事的程序:根据前面的文字,预测下一个字该是什么。它的知识停在训练截止那天、会一本正经地编、自己不能动你电脑里的任何东西、默认也不记得你上次说过什么。判断标准只有一条——这件事能不能靠「读懂文字 + 生成文字」完成,能,就交给它;不能,就得给它接上工具(那叫 Agent 工具)。

1
Step 1

开篇:你每天在用它,但没人跟你说清它是什么

ChatGPT、DeepSeek、Claude、Kimi、豆包——你多半已经用过其中一两个了。你发一段话,它回一段话,看起来无所不知。

但用着用着就会撞上几件怪事:

  • 你问它一个上个月刚发生的事,它说得头头是道,结果全是编的
  • 你让它「帮我把这个文件夹里的照片按日期改个名」,它给你一堆步骤,就是不动手
  • 你上次跟它说过的偏好,这次它完全不记得

这些都不是 bug,而是大模型这个东西本来就长这样

这一篇不讲神经网络、不讲参数量,只讲一件事:它到底在干什么,以及由此决定的——什么活能交给它,什么活它根本干不了。

这是整条学习路径的第一课,后面所有的名词(上下文、Skill、MCP、Agent)都建立在这一篇上。

2
Step 2

它在做的只有一件事:预测下一个字

大模型的全称是大语言模型,英文 Large Language Model,简称 LLM。你在中文语境里听到的「大模型」,基本都是指它。

它被造出来的时候,被训练去完成一个非常单调的任务:给它一段文字,让它猜下一个字(准确说是下一个 token)最可能是什么。

举个例子,看到「今天天气真」,它会算出后面接「好」的概率最高,于是输出「好」;然后把「今天天气真好」再读一遍,继续猜下一个字。就这样一个字一个字往外蹦,蹦出你看到的整段回答。

大模型通过不断预测下一个 Token 生成一句话
大模型通过不断预测下一个 Token 生成一句话

它是怎么学会猜的?训练的时候它读了海量的文本——网页、书、论坛、代码。读得足够多之后,文字之间的规律就被它学到了:什么问题后面通常跟什么答案,什么代码前面通常有什么注释。

所以它不是在「查资料」,也不是在「思考对错」,它是在生成最像正确答案的那段文字

这一句话是本篇的地基。下面四个限制,全都是从这句话直接推出来的。

3
Step 3

限制一:知识有截止日期

训练是一次性的工程:把海量文本喂给它,跑很久,得到一个模型。这批文本收集到哪一天,它的知识就停在哪一天,这个时间点叫知识截止日期(training cutoff)。

所以:

  • 截止之后发生的事,它默认不知道
  • 但你问它,它经常不会说不知道,而是照着「像那么回事」的样子给你编一段(原因见下一步)
  • 你更新不了它。这不是你的账号问题,而是要重新训练一个新版本

那为什么有时候它又能说出很新的事? 因为很多产品在模型外面接了联网搜索:你提问 → 产品先去搜 → 把搜到的网页内容一起塞给模型 → 模型基于这些内容回答。

这时候答对的功劳不在模型的记忆,而在于有人把新资料喂给了它。这也是后面所有工具(Skill、MCP、Agent)的共同思路:模型本身不变,变的是你给它什么材料、给它什么能力。

模型内部知识、知识截止日期与联网搜索的关系
模型内部知识、知识截止日期与联网搜索的关系

判断方法:涉及时效的问题(价格、版本号、政策、新闻),默认不要信它的记忆,要么让它联网查,要么你把资料贴给它。

4
Step 4

限制二:它会一本正经地编

这件事有个正式名字,叫幻觉(hallucination)——模型生成了事实上错误、或者和你给的资料对不上的内容。

原因还是那句话:它在生成最像正确答案的文字,不是在查表。所以一个不存在的论文标题、一个不存在的函数名、一个编出来的链接,在「像不像」这个维度上得分很高,它就写出来了。而且语气一样自信,看不出破绽。

大模型幻觉的生成过程与人工核验方法
大模型幻觉的生成过程与人工核验方法

这不是某个厂商的模型有问题,Anthropic 在自己的官方文档里写得很直接:即便是最先进的模型也会出现幻觉。官方给的三个应对办法,你直接就能用:

做法具体怎么说
允许它说不知道在你的要求后面加一句「如果资料里没有,就直接说没有,不要猜」
让它先引用原文处理长文档时,先让它把相关原文摘出来,再基于摘出来的内容回答
让它标出处每个结论后面标明依据哪一段,找不到依据的结论就删掉

再加一条你自己的习惯:凡是数字、人名、版本号、法规条款、链接,一律当成「待核实」,自己点开看一眼。

这不是不信任 AI,而是知道它的工作方式之后的正常操作。

5
Step 5

限制三:它自己动不了手

这一条是最多人误解的,也是下一篇的引子。

一个纯粹的大模型,唯一能做的事情就是输出文字。 你在聊天框里跟它说:

  • 「帮我把桌面上这 30 个文件按日期改名」——它给你一份改名步骤,或者一段脚本,但文件一个没动
  • 「帮我把这封邮件发出去」——它给你一份邮件正文,发不出去
  • 「看一下我项目里的这个报错」——它看不见你的项目,除非你把报错贴进去

它没有手,没有眼睛,也没有你电脑的权限。它甚至不知道你的电脑存在。

那为什么你看到有人说「我让 AI 把这批文件整理好了」?因为他用的不是聊天框里的模型,而是一个在模型外面装了工具的程序:这个程序把「读文件」「写文件」「运行命令」这些动作包装成模型可以调用的工具,模型说「我要读这个文件」,程序真的去读,再把结果给它。

大模型负责理解和生成指令,外部工具负责执行真实动作
大模型负责理解和生成指令,外部工具负责执行真实动作

这类程序就叫 Agent 工具——下一篇 1.2 专门讲它,那也是整个网站最重要的一篇。

记住这个分界:模型负责想和说,工具负责做。

6
Step 6

限制四:它默认不记得你

还有一个每天都会碰到的现象:新开一个对话,它就完全不认识你了。

原因是模型本身不存任何东西。每一次你按下回车,都是一次独立的请求:把这一轮需要它看到的全部文字打包发过去,它读完、回一段、然后什么都不留。

那为什么同一个对话里它记得上文?因为聊天软件替你做了一件事:每次都把之前的对话记录重新一起发过去。你看到的是「它记得」,实际发生的是「它每次都被重新告知一遍」。

聊天软件每轮重发历史对话形成上下文记忆
聊天软件每轮重发历史对话形成上下文记忆

这也解释了另外两个现象:

  • 聊得越久越慢、越贵:每一轮要重发的内容越来越长
  • 聊到很长会开始忘前面的:一次能带的文字量有上限,超了就得砍掉或压缩

这个「一次能看到多少文字」的额度,就是上下文窗口,也是第 2 段里专门要讲的概念(2.2)。

想让它稳定记住你的偏好和项目背景,靠的不是它的记忆力,而是把这些东西写进一份文件,每次自动带上——这是后面 4.3「如何给 AI 建立长期记忆」的主题。

7
Step 7

那它到底强在哪

说完四个限制,也要说清楚它真正厉害的地方,不然容易走到另一个极端。

凡是读懂文字、生成文字就能完成的事,它做得又快又稳:

类型具体的活
改写把口语整理成书面语、把长句拆短、换个语气重写
压缩总结长文、从会议记录里挑出待办
转换翻译、把一段文字整理成表格、把要求整理成清单
分类判断给一堆反馈打标签、判断这条消息属于哪一类
起草写初稿:方案、周报、邮件、文案、代码
解释把一段代码、一份合同、一个报错讲成人话

一条判断标准:这件事,如果一个聪明但对你的具体情况一无所知的人,只靠读你给的文字就能完成,那它多半也能完成;如果需要「去查最新的」「去点某个按钮」「去改某个文件」,那就超出模型本身的能力了,需要给它接工具。

注意后半句的「对你的具体情况一无所知」——你给的材料够不够,直接决定它答得好不好。这就是为什么第 4 段整段都在讲怎么给材料。

8
Step 8

总结:一张表记住大模型

回到最开始那句话:它在根据前面的文字,预测下一个字。 四个限制全从这里来。

现象真实原因你该怎么办
说不出最近发生的事知识停在训练截止那天让它联网查,或者你把资料贴给它
一本正经地编它生成的是「最像对的文字」允许它说不知道、让它引用原文、自己核实关键信息
只给方法不动手模型只能输出文字换 Agent 工具(下一篇)
新开对话就不认识你模型不存东西,历史靠每次重发把长期信息写成文件带上(4.3)

大模型不是一个什么都懂的专家,它是一个语言能力极强、但对你一无所知、也动不了手的助手。 接下来两件事决定你能用它做多少:给它什么材料(第 2、4 段),以及给它什么能力(下一篇 1.2)。

FAQ · 常见问题
大模型和 AI 是一回事吗?

不是。AI 是一个很大的范围,人脸识别、推荐算法、语音转文字都算 AI。大模型(LLM)特指这两年火起来的这类处理文字的模型,你在 ChatGPT、DeepSeek、Claude 里对话的就是它。

为什么它有时候答对了最新的消息?

因为产品在模型外面接了联网搜索:先去搜,再把搜到的内容和你的问题一起交给模型。答对靠的是那份新资料,不是模型的记忆。所以同一个模型,在有联网的产品里和在纯 API 里表现会不一样。

参数量越大的模型就越好吗?

不一定,而且对你来说这个数字基本没有决策价值。真正影响你使用体验的是:这一代模型的整体能力、上下文窗口多大、响应快不快、多少钱。怎么按任务选模型,看 2.6「Token 与模型选择」。

它会不会偷偷学走我发给它的内容?

取决于你用的产品和账号类型,各家的数据使用政策不同,企业版通常承诺不用于训练。习惯上:涉密材料、身份证号、密钥这类东西不要往对话框里贴,本地跑的模型或公司内部部署是更稳妥的选择。

← 上一篇这里是路径起点下一篇 →大模型和 Agent 工具的区别
1 / 8