← 返回大模型和 Agent 工具的区别
1 / 7
Tutorial·7

大模型和 Agent 工具的区别

同样是 AI,为什么别人能让它把一个文件夹整理完,你的却只会给步骤?讲清 Agent 工具比聊天框多出来的三样东西,以及什么时候该换过去

TL;DR · 一句话结论

聊天框里的大模型只能输出文字,所有动作都得你自己做:复制进去、复制出来、按它说的操作。Agent 工具是在模型外面装了工具和一个循环——它能读你的文件、改你的文件、运行命令、查网页,而且会自己决定下一步做什么,一直做到任务完成。分界线只有一句:**要不要你亲自动手**。需要 AI 真的操作东西,就用 Agent 工具;只是要一段文字,聊天框足够。

1
Step 1

开篇:为什么别人的 AI 能「干活」,你的只能「说话」

你可能刷到过这样的分享:

「我让 AI 把这一年的 200 张发票按月份归档、重命名,五分钟搞定。」 「我让 AI 读完这个项目的代码,自己找到 bug 改好,跑通测试。」

然后你打开自己常用的聊天框,一字不差地照着说,得到的是——一份非常详细的操作步骤。文件一个没动。

差别不在提示词,也不在模型。差别在于:他们用的根本不是同一类产品。

聊天框只能输出文字,Agent 工具可以读取并执行
聊天框只能输出文字,Agent 工具可以读取并执行

上一篇讲过,大模型本身只能输出文字。这一篇讲清楚:在模型外面加上什么,它才真的能动手;这类工具叫什么、能干什么、代价是什么。

这是整个网站最重要的一篇。看完这一篇,你才知道自己接下来该装什么。

2
Step 2

聊天框:所有动作都是你在做

先看清楚你现在的用法。以「把 30 个文件按拍摄日期改名」为例,在聊天框里的流程是这样的:

  1. 你把文件名列表复制出来,粘贴进对话框
  2. 它给你一份新旧对照表,或者一段脚本
  3. 你把对照表复制出来
  4. 你一个一个去改名,或者把脚本粘到终端里执行
  5. 出错了,你把报错再复制回去问它

数一数:这里面 AI 做了几步?只有第 2 步。剩下的搬运和执行,全是你在做

聊天框的形态决定了它只有一个入口和一个出口:文字进、文字出。它看不见你的电脑,也碰不到你的文件。

这不是缺点。写文案、改简历、翻译、想标题、解释概念——这些事本来就只需要文字进出,聊天框是最顺手的。

问题出在另一类任务上:做完这件事需要真的操作东西。 这时候你就是那个人肉搬运工,AI 越聪明,你搬得越累。

3
Step 3

Agent 工具:模型 + 工具 + 循环

Agent 工具(也叫 AI Agent、智能体、代理)是在模型外面套了一层程序。这层程序给模型加了两样东西:

第一样:工具。 程序把一批动作包装成模型可以调用的能力,常见的有:

工具模型能做的事
读文件打开你指定目录下的文件,看到里面的内容
写文件 / 改文件新建、修改、覆盖文件
运行命令在你的电脑上执行命令行指令
搜索在一堆文件里找关键词,或者上网查
连接外部系统通过 MCP 接上数据库、设计稿、日历等(2.4 会讲)

第二样:循环。 它不是回答一次就结束,而是反复地:看目标 → 决定下一步 → 调用工具 → 看结果 → 再决定,直到任务完成或者卡住。

Agent 工具由大模型、工具和执行循环组成
Agent 工具由大模型、工具和执行循环组成

Anthropic 在官方文章里给的定义很清楚:Agent 是「由大模型自己动态决定流程和工具使用」的系统,与之相对的是路径被代码写死的「工作流」。

所以 Agent 工具的本质不神秘:一个会自己决定下一步、并且真的能执行的循环。

4
Step 4

同一件事,两种做法对照

还是那 30 个文件。换成 Agent 工具之后,流程变成:

  1. 你在目标文件夹里打开工具,说一句:「把这个文件夹里的照片,按拍摄日期改名成 2026-08-18-01 这种格式,先给我看一下改名方案」
  2. 自己去读这个文件夹,列出 30 个文件和它们的日期
  3. 它给出方案,你看一眼,说「可以,执行」
  4. 自己改,改完告诉你结果,有 3 个没有日期信息,它单独列出来问你怎么办

你做的事:说了两句话,看了一眼方案。

同一个文件改名任务在聊天框与 Agent 工具中的流程对比
同一个文件改名任务在聊天框与 Agent 工具中的流程对比
聊天框Agent 工具
谁来收集材料你复制粘贴它自己读
谁来执行
出错了怎么办你把报错贴回去它看到报错,自己再试
中间步骤你一步步跟着做它自己走完,需要确认时才找你
你的角色搬运工 + 执行者提要求 + 把关

这就是那句在国外社区被反复强调的话:不是把内容粘贴进对话框再复制回来,而是把 AI 指向一个文件夹,它真的读写你的文件。

5
Step 5

代价:它真的会动你的东西

能力和风险是同一件事的两面。用 Agent 工具之前,有四件事必须知道:

1. 它真的会改文件。 说了「整理这个文件夹」,它就会去动里面的东西。第一次用,务必挑一个不重要的文件夹,或者先做好备份。做开发的话,用 Git 存档(6.7 有专门一篇)。

2. 默认会问你,但可以被关掉。 主流工具在执行有风险的动作前会弹出确认。不要因为嫌烦就把确认全部关掉,尤其是在你还不熟的时候。

3. 它会花钱,而且比聊天贵。 一次任务里它可能读几十个文件、调用十几次工具,每一次都是一轮模型请求。为什么这样算钱、怎么省,看 2.6。

4. 它会做错。 它可能理解偏、可能改到不该改的地方。所以两个习惯很重要:先让它给方案再执行,以及有版本管理能回退

使用 Agent 工具时需要方案、确认、备份和回退四道护栏
使用 Agent 工具时需要方案、确认、备份和回退四道护栏

一句话:Agent 工具把你从执行者变成了把关的人。把关这件事不能省。

6
Step 6

常见的 Agent 工具长什么样

现在市面上的 Agent 工具主要有三种形态:

① 终端里的(这类最主流,本站第 3 段主要教的就是它们)

  • Claude Code(Anthropic)
  • Codex(OpenAI)
  • DeepSeek Harness / dsh(DeepSeek 官方开源)
  • Kimi Code(月之暗面)
  • Gemini CLI(Google)

它们都跑在命令行里,你在哪个文件夹打开它,它就以那个文件夹为工作区。装它们之前建议先看 3.1「命令行/终端是什么」。

② 编辑器 / IDE 里的:Cursor、Trae、VS Code 里的 Copilot 等,界面友好,主要面向写代码。

③ 桌面端 / 聊天软件里的:比如 OpenClaw 这类可以接进飞书、微信的助理。

名字很多,但内核是同一套:一个模型 + 一批工具 + 一个循环。学会一个,换另一个只是换个界面。

所以不要纠结「先学哪个」。挑一个你能用上的模型对应的工具装上,先跑通一次完整任务,比看十篇对比评测有用。

7
Step 7

什么时候用哪个:一条分界线

不用记复杂的规则,问自己一句话:

这件事做完,需不需要我亲自去操作什么?

根据是否需要真实操作以及搬运成本选择聊天框或 Agent 工具
根据是否需要真实操作以及搬运成本选择聊天框或 Agent 工具
你的任务用什么
写一段文案 / 改简历 / 翻译 / 想选题聊天框就够
解释一个概念、一段代码、一份合同聊天框就够
整理一个文件夹里的几十个文件Agent 工具
读完十几份文档,汇总成一份报告Agent 工具
把一个表格清洗干净并另存Agent 工具
做一个能打开的网页 / 小工具Agent 工具
每周重复的一套固定流程Agent 工具 + Skill(2.3)

中间地带:任务不长、材料不多,你复制粘贴几次就完事的,聊天框反而更快。判断依据是搬运成本——当你发现自己在反复复制粘贴的时候,就该换工具了。


大模型是能力的上限,Agent 工具决定这些能力能不能落到你的真实文件上。 接下来第 2 段会把 agent 工具里那些高频黑话(Prompt、Context、Skill、MCP、Subagent、Token)一次讲清,第 3 段带你把工具装起来。

FAQ · 常见问题
Agent、智能体、AI Agent、Agent 工具,是同一个东西吗?

日常语境里基本可以当成一回事。严格一点说:Agent 指的是「模型自己决定流程并调用工具」这套机制,Agent 工具指的是把这套机制做成的产品(Claude Code、Codex 这些)。你听到「智能体」,通常也是指这个。

Agent 工具还是用同一个大模型吗?

是的,底下还是那些模型。区别在于外面这层程序给了它工具和循环。很多 agent 工具还支持换模型——同一个工具接不同厂商的模型,比如 Codex 接 DeepSeek,本站有专门的教程。

不会写代码能用终端里的 Agent 工具吗?

能。你输入的是中文要求,不是代码。唯一的门槛是要会打开终端、切换到目标文件夹这几个基本操作,这正是 3.1 那一篇要解决的。

它会不会把我的文件删了?

有可能,所以有三条基本纪律:第一次拿不重要的文件夹试;保留系统的确认弹窗,不要一上来就全部放行;重要目录先备份,做开发就用 Git 存档。

1 / 7