一句话定义

Agent 是一个能自己动手把事办成的 AI 程序。 普通聊天 AI 你问它答,Agent 是你给它一个目标,它会自己去拆解步骤、调用工具、试错、直到把事情做成。

跟聊天 AI 的差别

聊天 AI(如 ChatGPT 网页版)Agent
你给什么一句话问题一个目标(比如「帮我把这周邮件总结一下」)
它怎么答直接回答自己拆任务 → 调工具 → 试错 → 给你结果
能不能动真东西不能,只能给文字建议能:读写文件、跑命令、发邮件、订机票
一次对话单轮多轮,自己跑十几步甚至上百步

举个例子:

  • 让 ChatGPT「帮我写一封请假邮件」→ 它给你一段文字,你复制去发。
  • 让 Agent「帮我写并发送一封请假邮件」→ 它自己写、自己登录邮箱、自己点发送。

一个 Agent 内部长什么样

最常见的结构是三件套:

  1. 大脑(LLM) —— 负责理解和决策。现在基本是 GPT-4、Claude 这种大语言模型。
  2. 记忆 —— 短期记忆是当前对话,长期记忆可以存到文件或数据库,下次接着用。
  3. 工具(Tools) —— 大脑能调用的功能,比如:跑终端命令、读文件、搜网页、发 HTTP 请求、调用别的 API。

Agent 工作的循环很简单:观察 → 思考 → 行动 → 再观察,一直到目标完成。

Agent 现在能干什么

  • 编程:写代码、改 bug、跑测试、提交 GitHub PR(Cursor、Claude Code、Devin)
  • 办公自动化:整理邮件、生成报表、订会议室(n8n、Make、Zapier 这些带 AI 的版本)
  • 研究:自动搜资料、读论文、生成综述(GPT Researcher、Perplexity Pro 的 Deep Research)
  • 日常:订餐、买东西、规划行程(早期,但进步很快)
  • 控制电脑:像人一样操作浏览器和软件(Anthropic 的 Computer Use、OpenAI 的 Operator)

它现在的局限

  • 会出错 —— 大模型本身有幻觉,工具也可能调用失败,需要人在关键步骤把关。
  • —— 一个复杂任务跑下来可能烧几毛到几十块的 API 费用。
  • —— 多步任务一次跑几分钟很正常,比人快但不是瞬时。
  • 权限边界 —— 它能动真东西,给多大权限是个严肃决定;目前主流做法是「人在回路」,关键动作要你确认。

怎么判断一件事该不该用 Agent

问自己三个问题:

  1. 任务能拆成小步骤吗? 能拆就适合 Agent。
  2. 每一步有可验证的结果吗? 比如"文件写出来了"、"命令跑成功了"。如果没法验证,Agent 会跑偏。
  3. 出错了代价多大? 写邮件失败只是重发,转账失败就是真钱。代价高的环节必须人盯着。

三个都是 ✅,基本就适合放给 Agent 做。

一句话总结

Agent 不是更聪明的聊天 AI,而是能动手把事情做完的 AI。它把"想法"变成了"动作",但目前还不完美,关键环节需要人看着。