同样是 AI,为什么别人能让它把一个文件夹整理完,你的却只会给步骤?讲清 Agent 工具比聊天框多出来的三样东西,以及什么时候该换过去
聊天框里的大模型只能输出文字,所有动作都得你自己做:复制进去、复制出来、按它说的操作。Agent 工具是在模型外面装了工具和一个循环——它能读你的文件、改你的文件、运行命令、查网页,而且会自己决定下一步做什么,一直做到任务完成。分界线只有一句:**要不要你亲自动手**。需要 AI 真的操作东西,就用 Agent 工具;只是要一段文字,聊天框足够。
你可能刷到过这样的分享:
「我让 AI 把这一年的 200 张发票按月份归档、重命名,五分钟搞定。」 「我让 AI 读完这个项目的代码,自己找到 bug 改好,跑通测试。」
然后你打开自己常用的聊天框,一字不差地照着说,得到的是——一份非常详细的操作步骤。文件一个没动。
差别不在提示词,也不在模型。差别在于:他们用的根本不是同一类产品。

上一篇讲过,大模型本身只能输出文字。这一篇讲清楚:在模型外面加上什么,它才真的能动手;这类工具叫什么、能干什么、代价是什么。
这是整个网站最重要的一篇。看完这一篇,你才知道自己接下来该装什么。
先看清楚你现在的用法。以「把 30 个文件按拍摄日期改名」为例,在聊天框里的流程是这样的:
数一数:这里面 AI 做了几步?只有第 2 步。剩下的搬运和执行,全是你在做。
聊天框的形态决定了它只有一个入口和一个出口:文字进、文字出。它看不见你的电脑,也碰不到你的文件。
这不是缺点。写文案、改简历、翻译、想标题、解释概念——这些事本来就只需要文字进出,聊天框是最顺手的。
问题出在另一类任务上:做完这件事需要真的操作东西。 这时候你就是那个人肉搬运工,AI 越聪明,你搬得越累。
Agent 工具(也叫 AI Agent、智能体、代理)是在模型外面套了一层程序。这层程序给模型加了两样东西:
第一样:工具。 程序把一批动作包装成模型可以调用的能力,常见的有:
| 工具 | 模型能做的事 |
|---|---|
| 读文件 | 打开你指定目录下的文件,看到里面的内容 |
| 写文件 / 改文件 | 新建、修改、覆盖文件 |
| 运行命令 | 在你的电脑上执行命令行指令 |
| 搜索 | 在一堆文件里找关键词,或者上网查 |
| 连接外部系统 | 通过 MCP 接上数据库、设计稿、日历等(2.4 会讲) |
第二样:循环。 它不是回答一次就结束,而是反复地:看目标 → 决定下一步 → 调用工具 → 看结果 → 再决定,直到任务完成或者卡住。

Anthropic 在官方文章里给的定义很清楚:Agent 是「由大模型自己动态决定流程和工具使用」的系统,与之相对的是路径被代码写死的「工作流」。
所以 Agent 工具的本质不神秘:一个会自己决定下一步、并且真的能执行的循环。
还是那 30 个文件。换成 Agent 工具之后,流程变成:
2026-08-18-01 这种格式,先给我看一下改名方案」你做的事:说了两句话,看了一眼方案。

| 聊天框 | Agent 工具 | |
|---|---|---|
| 谁来收集材料 | 你复制粘贴 | 它自己读 |
| 谁来执行 | 你 | 它 |
| 出错了怎么办 | 你把报错贴回去 | 它看到报错,自己再试 |
| 中间步骤 | 你一步步跟着做 | 它自己走完,需要确认时才找你 |
| 你的角色 | 搬运工 + 执行者 | 提要求 + 把关 |
这就是那句在国外社区被反复强调的话:不是把内容粘贴进对话框再复制回来,而是把 AI 指向一个文件夹,它真的读写你的文件。
能力和风险是同一件事的两面。用 Agent 工具之前,有四件事必须知道:
1. 它真的会改文件。 说了「整理这个文件夹」,它就会去动里面的东西。第一次用,务必挑一个不重要的文件夹,或者先做好备份。做开发的话,用 Git 存档(6.7 有专门一篇)。
2. 默认会问你,但可以被关掉。 主流工具在执行有风险的动作前会弹出确认。不要因为嫌烦就把确认全部关掉,尤其是在你还不熟的时候。
3. 它会花钱,而且比聊天贵。 一次任务里它可能读几十个文件、调用十几次工具,每一次都是一轮模型请求。为什么这样算钱、怎么省,看 2.6。
4. 它会做错。 它可能理解偏、可能改到不该改的地方。所以两个习惯很重要:先让它给方案再执行,以及有版本管理能回退。

一句话:Agent 工具把你从执行者变成了把关的人。把关这件事不能省。
现在市面上的 Agent 工具主要有三种形态:
① 终端里的(这类最主流,本站第 3 段主要教的就是它们)
dsh(DeepSeek 官方开源)它们都跑在命令行里,你在哪个文件夹打开它,它就以那个文件夹为工作区。装它们之前建议先看 3.1「命令行/终端是什么」。
② 编辑器 / IDE 里的:Cursor、Trae、VS Code 里的 Copilot 等,界面友好,主要面向写代码。
③ 桌面端 / 聊天软件里的:比如 OpenClaw 这类可以接进飞书、微信的助理。
名字很多,但内核是同一套:一个模型 + 一批工具 + 一个循环。学会一个,换另一个只是换个界面。
所以不要纠结「先学哪个」。挑一个你能用上的模型对应的工具装上,先跑通一次完整任务,比看十篇对比评测有用。
不用记复杂的规则,问自己一句话:
这件事做完,需不需要我亲自去操作什么?

| 你的任务 | 用什么 |
|---|---|
| 写一段文案 / 改简历 / 翻译 / 想选题 | 聊天框就够 |
| 解释一个概念、一段代码、一份合同 | 聊天框就够 |
| 整理一个文件夹里的几十个文件 | Agent 工具 |
| 读完十几份文档,汇总成一份报告 | Agent 工具 |
| 把一个表格清洗干净并另存 | Agent 工具 |
| 做一个能打开的网页 / 小工具 | Agent 工具 |
| 每周重复的一套固定流程 | Agent 工具 + Skill(2.3) |
中间地带:任务不长、材料不多,你复制粘贴几次就完事的,聊天框反而更快。判断依据是搬运成本——当你发现自己在反复复制粘贴的时候,就该换工具了。
大模型是能力的上限,Agent 工具决定这些能力能不能落到你的真实文件上。 接下来第 2 段会把 agent 工具里那些高频黑话(Prompt、Context、Skill、MCP、Subagent、Token)一次讲清,第 3 段带你把工具装起来。
日常语境里基本可以当成一回事。严格一点说:Agent 指的是「模型自己决定流程并调用工具」这套机制,Agent 工具指的是把这套机制做成的产品(Claude Code、Codex 这些)。你听到「智能体」,通常也是指这个。
是的,底下还是那些模型。区别在于外面这层程序给了它工具和循环。很多 agent 工具还支持换模型——同一个工具接不同厂商的模型,比如 Codex 接 DeepSeek,本站有专门的教程。
能。你输入的是中文要求,不是代码。唯一的门槛是要会打开终端、切换到目标文件夹这几个基本操作,这正是 3.1 那一篇要解决的。
有可能,所以有三条基本纪律:第一次拿不重要的文件夹试;保留系统的确认弹窗,不要一上来就全部放行;重要目录先备份,做开发就用 Git 存档。