Agent 是什么
一句话定义
Agent 是一个能自己动手把事办成的 AI 程序。 普通聊天 AI 你问它答,Agent 是你给它一个目标,它会自己去拆解步骤、调用工具、试错、直到把事情做成。
跟聊天 AI 的差别
| 聊天 AI(如 ChatGPT 网页版) | Agent | |
|---|---|---|
| 你给什么 | 一句话问题 | 一个目标(比如「帮我把这周邮件总结一下」) |
| 它怎么答 | 直接回答 | 自己拆任务 → 调工具 → 试错 → 给你结果 |
| 能不能动真东西 | 不能,只能给文字建议 | 能:读写文件、跑命令、发邮件、订机票 |
| 一次对话 | 单轮 | 多轮,自己跑十几步甚至上百步 |
举个例子:
- 让 ChatGPT「帮我写一封请假邮件」→ 它给你一段文字,你复制去发。
- 让 Agent「帮我写并发送一封请假邮件」→ 它自己写、自己登录邮箱、自己点发送。
一个 Agent 内部长什么样
最常见的结构是三件套:
- 大脑(LLM) —— 负责理解和决策。现在基本是 GPT-4、Claude 这种大语言模型。
- 记忆 —— 短期记忆是当前对话,长期记忆可以存到文件或数据库,下次接着用。
- 工具(Tools) —— 大脑能调用的功能,比如:跑终端命令、读文件、搜网页、发 HTTP 请求、调用别的 API。
Agent 工作的循环很简单:观察 → 思考 → 行动 → 再观察,一直到目标完成。
Agent 现在能干什么
- 编程:写代码、改 bug、跑测试、提交 GitHub PR(Cursor、Claude Code、Devin)
- 办公自动化:整理邮件、生成报表、订会议室(n8n、Make、Zapier 这些带 AI 的版本)
- 研究:自动搜资料、读论文、生成综述(GPT Researcher、Perplexity Pro 的 Deep Research)
- 日常:订餐、买东西、规划行程(早期,但进步很快)
- 控制电脑:像人一样操作浏览器和软件(Anthropic 的 Computer Use、OpenAI 的 Operator)
它现在的局限
- 会出错 —— 大模型本身有幻觉,工具也可能调用失败,需要人在关键步骤把关。
- 贵 —— 一个复杂任务跑下来可能烧几毛到几十块的 API 费用。
- 慢 —— 多步任务一次跑几分钟很正常,比人快但不是瞬时。
- 权限边界 —— 它能动真东西,给多大权限是个严肃决定;目前主流做法是「人在回路」,关键动作要你确认。
怎么判断一件事该不该用 Agent
问自己三个问题:
- 任务能拆成小步骤吗? 能拆就适合 Agent。
- 每一步有可验证的结果吗? 比如"文件写出来了"、"命令跑成功了"。如果没法验证,Agent 会跑偏。
- 出错了代价多大? 写邮件失败只是重发,转账失败就是真钱。代价高的环节必须人盯着。
三个都是 ✅,基本就适合放给 Agent 做。
一句话总结
Agent 不是更聪明的聊天 AI,而是能动手把事情做完的 AI。它把"想法"变成了"动作",但目前还不完美,关键环节需要人看着。
暂无标签