AI 101 · FREE PREVIEW
让直觉赶上时代
写给非技术人员的 AI 说明书
关于 AI 的信息,你可能已经看过很多了,但多数要么是程序员写给程序员看的,要么是营销号的故弄玄虚,要么是别人直接拿结果给你看,却不告诉你背后的原理。
真正从普通人的视角出发,把模型、Agent、工具这些概念讲明白的内容一直很少。这个领域变化很快,快到任何一篇文章写完就可能过时,但有些东西不会过时:对概念的理解、对新工具底层结构的直觉、对变化的判断。
这本书想带给你的是后者。你不需要技术背景。
让概念落地,陪你一起度过时代的湍流。看见 AI,也看见人。
目录
第一章 认知篇 — 看懂 AI 的大脑
第二章 Agent 篇 — 从聊天到干活
第三章 上手篇 — 把 Agent 用起来
- 07从 App 到终端 — 工具选择与安装
- 08Skills — 把你的做法教给 Agent
- 09端侧与本地 — 把模型装进自己的设备
第四章 心法篇 — 用好 AI 的基本功
- 10和 AI 对话的五个技巧
- 11安全与隐私 — 三条实用原则
第五章 视野篇 — 技术之上
- 12当 AI 遇上真实商业场景
- 13GEO — AI 时代的"被发现"逻辑
- 14结语:最难的部分不是技术,是人
附录 参考资料
- AAI 术语词典
- B海外产品 ↔ 中国大陆平替速查表
试读 · 第一、二章全文
以下为全书前两章的完整内容,未作删节。第三章之后为完整版内容。
第一章 认知篇 — 看懂 AI 的大脑
AI 能做什么、做不了什么、以及为什么。后面的一切,都建立在这颗大脑之上。
01 LLM 是什么 — 文字接龙 · Transformer · 注意力
什么是 LLM
LLM(Large Language Model,大语言模型)是 ChatGPT、Claude、DeepSeek 等产品背后的核心技术。它本质上是一个被喂了海量文字训练出来的"超级文字接龙机器",你给它一句话的开头,它就能根据学到的规律把后面的内容续写出来。
你和 AI 的每一次对话、后面章节里 Agent 干的每一件活,背后都是这台接龙机器在工作。这一章分三步展开,先看它的内部构造(Transformer),再看它怎么被训练出来(第 2 节),最后看它的性格与短板(第 3 节)。
你和 AI 的每一次对话、后面章节里 Agent 干的每一件活,背后都是这台接龙机器在工作。这一章分三步展开,先看它的内部构造(Transformer),再看它怎么被训练出来(第 2 节),最后看它的性格与短板(第 3 节)。
内部构造:GPT 的 T,就是 Transformer
刚才说 LLM 是"超级文字接龙机器",那么这台接龙机器的内部构造长什么样?
答案是一个词,Transformer(变换器)。
2017 年,Google 的几位研究员发表了一篇论文,标题本身就是宣言:《Attention Is All You Need》(注意力就是你的全部所需)。论文里提出的这个新架构就是 Transformer,当时没几个人意识到,它会成为之后整个 AI 时代的地基。
今天你听到的所有大模型,ChatGPT、Claude、Gemini、DeepSeek,全部是 Transformer 架构的变体。GPT 的全称是 Generative Pre-trained Transformer(生成式预训练变换器),那个 T 就是它。模型千千万,底座只有一个。
答案是一个词,Transformer(变换器)。
2017 年,Google 的几位研究员发表了一篇论文,标题本身就是宣言:《Attention Is All You Need》(注意力就是你的全部所需)。论文里提出的这个新架构就是 Transformer,当时没几个人意识到,它会成为之后整个 AI 时代的地基。
今天你听到的所有大模型,ChatGPT、Claude、Gemini、DeepSeek,全部是 Transformer 架构的变体。GPT 的全称是 Generative Pre-trained Transformer(生成式预训练变换器),那个 T 就是它。模型千千万,底座只有一个。
旁 注把"架构"理解成大脑的解剖结构就好。不同的模型(GPT-5.5、Claude Fable 5、DeepSeek V4)就像不同的人,知识量、性格、擅长领域各不相同,但解剖开来,大脑结构是同一套。各家比拼的是怎么训练这颗大脑,没有人在重新发明大脑。
Transformer 的灵魂:注意力机制 — "哪个词该看哪个词"
Transformer 的核心就是论文标题里那个词,注意力(Attention)。
先看一句话:
"李雷把苹果递给韩梅梅,因为她饿了。"
问:"她"是谁?你不假思索就知道是韩梅梅。你的大脑在读到"她"的瞬间自动回头扫了一遍前文,把"她"和"韩梅梅"连了起来,而不会连到"李雷"或"苹果"上去。
注意力机制做的就是这件事。处理每一个词的时候,让这个词"环顾四周",给句子里所有其他词打一个相关度分数,"她"和"韩梅梅"高度相关,得高分,和"苹果"基本无关,得低分。理解一个词的含义时,主要参考高分的那些词。
先看一句话:
"李雷把苹果递给韩梅梅,因为她饿了。"
问:"她"是谁?你不假思索就知道是韩梅梅。你的大脑在读到"她"的瞬间自动回头扫了一遍前文,把"她"和"韩梅梅"连了起来,而不会连到"李雷"或"苹果"上去。
注意力机制做的就是这件事。处理每一个词的时候,让这个词"环顾四周",给句子里所有其他词打一个相关度分数,"她"和"韩梅梅"高度相关,得高分,和"苹果"基本无关,得低分。理解一个词的含义时,主要参考高分的那些词。
旁 注想象一间会议室,句子里的每个词都是一位参会者。开会时所有人同时互相看一眼,各自判断"在场的人里谁跟我的议题最相关"。"她"看了一圈,目光锁定"韩梅梅";"递给"看了一圈,锁定"李雷"和"韩梅梅"。一轮"对视"下来,每个词都知道了自己在这句话里的真正含义。Transformer 内部把这样的对视做上几十甚至上百层,一层比一层理解得深,浅层看清语法,深层悟出语义、逻辑甚至弦外之音。
为什么是 Transformer 引爆了 AI — 一个工程上的关键优势
在 Transformer 之前,主流方法(RNN,循环神经网络)读句子像人朗读,必须从左到右一个词一个词来,读完第 3 个词才能读第 4 个。句子一长就容易忘了开头,更要命的是没法并行,再多计算芯片也使不上劲。
Transformer 的会议室模式完全不同,所有词同时互相打分,一步到位,计算因此可以拆成海量小任务同时进行,而"同时做海量小计算"恰好是 GPU(图形处理器)最擅长的事。
Transformer 的会议室模式完全不同,所有词同时互相打分,一步到位,计算因此可以拆成海量小任务同时进行,而"同时做海量小计算"恰好是 GPU(图形处理器)最擅长的事。
01Transformer 架构计算可以大规模并行
02堆更多 GPU 就能训更大的模型规模不再受架构限制
03Scaling Law 生效越大越聪明(下一节详讲)
04ChatGPT 时刻2022 年,AI 走进大众视野
一句话串起来注意力机制让 AI 真正读懂了上下文,可并行的结构让"大力出奇迹"成为可能。理解力加上可扩展性,两者凑齐才有了这一轮 AI 爆发。下一节要讲的训练与 Scaling Law,就建立在这个地基上。
两个高频词解释。
参数(Parameter):新闻里总说"万亿参数大模型",参数就是这颗 Transformer 大脑里可以调节的旋钮。训练模型的过程,就是把海量文字喂进去,让机器自动微调这上万亿个旋钮,直到文字接龙接得又准又好。旋钮越多,能存下的规律就越细腻,"参数越多模型越聪明"的说法由此而来。比如 DeepSeek V4 的总参数有 1.6 万亿个。
多模态(Multi-modal):Transformer 真正处理的东西叫 Token 序列,文字是切碎之后的 Token,图片切成小块、声音切成片段,一样能变成 Token 喂给它。所以今天的模型能看图、听声音、生成视频,底层还是同一套架构在工作,生图和生视频模型的核心部件同样源自 Transformer 家族。
参数(Parameter):新闻里总说"万亿参数大模型",参数就是这颗 Transformer 大脑里可以调节的旋钮。训练模型的过程,就是把海量文字喂进去,让机器自动微调这上万亿个旋钮,直到文字接龙接得又准又好。旋钮越多,能存下的规律就越细腻,"参数越多模型越聪明"的说法由此而来。比如 DeepSeek V4 的总参数有 1.6 万亿个。
多模态(Multi-modal):Transformer 真正处理的东西叫 Token 序列,文字是切碎之后的 Token,图片切成小块、声音切成片段,一样能变成 Token 喂给它。所以今天的模型能看图、听声音、生成视频,底层还是同一套架构在工作,生图和生视频模型的核心部件同样源自 Transformer 家族。
一句话总结Transformer 是所有现代 AI 模型共用的大脑结构,它靠注意力读懂上下文,靠可并行实现规模化。新模型层出不穷,底座至今没换过,变的是训练方法和数据,不是大脑结构。
02 一个模型是怎么训练出来的 — 预训练 · 微调 · 人类反馈
AI 的聪明,是写出来的,还是学出来的?
AI 发展历史上有两条路线。
"背答案"派(学术名叫符号主义,已过时):人类把规则一条条写死在程序里,问"苹果什么颜色",得有人提前写好"苹果=红色",没写过的问题就不会答。过去几十年的传统软件全是这个思路。
"刷题"派(学术名叫联结主义,现在所有 AI 都走这条路):不写规则,把海量数据喂给神经网络,让它自己悟出规律。ChatGPT、Claude、DeepSeek 全部属于这一派,而这套神经网络的具体结构,就是上一节讲的 Transformer。
所以答案是学出来的。没有任何一个工程师往模型里写过"苹果是红色的"这条规则,它是从几万亿字里自己悟出来的。理解了这一点,"训练"这个词才算真正落地。
那具体是怎么刷题的?把整个过程想象成培养一位新员工,一共三步。
"背答案"派(学术名叫符号主义,已过时):人类把规则一条条写死在程序里,问"苹果什么颜色",得有人提前写好"苹果=红色",没写过的问题就不会答。过去几十年的传统软件全是这个思路。
"刷题"派(学术名叫联结主义,现在所有 AI 都走这条路):不写规则,把海量数据喂给神经网络,让它自己悟出规律。ChatGPT、Claude、DeepSeek 全部属于这一派,而这套神经网络的具体结构,就是上一节讲的 Transformer。
所以答案是学出来的。没有任何一个工程师往模型里写过"苹果是红色的"这条规则,它是从几万亿字里自己悟出来的。理解了这一点,"训练"这个词才算真正落地。
那具体是怎么刷题的?把整个过程想象成培养一位新员工,一共三步。
第一步:预训练 — 先博览群书
预训练(Pre-training)就是那场规模大到超出直觉的"文字接龙特训"。把互联网上几乎所有公开文字,维基百科、书籍、论文、新闻、论坛帖子、代码,一段一段喂给模型,遮住后半句让它猜下一个词是什么。
猜错了怎么办?把上万亿个参数旋钮朝着"下次能猜对"的方向各微调一点点,然后换下一段再来。这个动作重复几万亿次之后,模型就把人类写下的语言规律、事实知识、推理套路全部压进了那些旋钮里。
用新员工的比喻,这一步相当于通识教育,把图书馆读穿。产出的东西叫基座模型(Base Model),博学,但不好用。你问它"北京有什么好玩的?",它可能接一句"这是我去年在知乎看到的一个问题",因为它只学会了接龙,还没学会对话。
猜错了怎么办?把上万亿个参数旋钮朝着"下次能猜对"的方向各微调一点点,然后换下一段再来。这个动作重复几万亿次之后,模型就把人类写下的语言规律、事实知识、推理套路全部压进了那些旋钮里。
用新员工的比喻,这一步相当于通识教育,把图书馆读穿。产出的东西叫基座模型(Base Model),博学,但不好用。你问它"北京有什么好玩的?",它可能接一句"这是我去年在知乎看到的一个问题",因为它只学会了接龙,还没学会对话。
第二步:监督微调 — 岗前示范
怎么让接龙机器变成助手?给它看示范。
监督微调(SFT,Supervised Fine-tuning):由人类撰写几万条高质量的标准问答,用户这样问,好的助手应该那样答,让模型照着模仿。数量不大,相比预训练的几万亿字只是九牛一毛,但作用关键,它教会模型"你现在的角色是助手,遇到问题要好好回答,不能随意接龙"。
新员工的比喻里,这一步是岗前培训,师傅带着做几十个标准案例,新人就知道这家公司的活该怎么干了。
监督微调(SFT,Supervised Fine-tuning):由人类撰写几万条高质量的标准问答,用户这样问,好的助手应该那样答,让模型照着模仿。数量不大,相比预训练的几万亿字只是九牛一毛,但作用关键,它教会模型"你现在的角色是助手,遇到问题要好好回答,不能随意接龙"。
新员工的比喻里,这一步是岗前培训,师傅带着做几十个标准案例,新人就知道这家公司的活该怎么干了。
第三步:人类反馈 — 打磨分寸感
示范学完了还有最后一步。什么样的回答算"更好"?礼貌到什么程度?遇到危险问题要不要拒绝?这些很难靠示范穷举,只能靠反馈。
人类反馈强化学习(RLHF)的做法是让模型对同一个问题生成多个回答,由人类标注员排序打分,再用这些打分训练出一个评分模型,然后让主模型朝着得分更高的方向持续调整。你感受到的模型"性格",语气、耐心、拒答的边界,主要都来自这一步。
新员工的比喻里,这是绩效反馈,干得好的地方强化,不合适的地方纠正,几轮下来新人就有了分寸。
人类反馈强化学习(RLHF)的做法是让模型对同一个问题生成多个回答,由人类标注员排序打分,再用这些打分训练出一个评分模型,然后让主模型朝着得分更高的方向持续调整。你感受到的模型"性格",语气、耐心、拒答的边界,主要都来自这一步。
新员工的比喻里,这是绩效反馈,干得好的地方强化,不合适的地方纠正,几轮下来新人就有了分寸。
这一步有个副作用被打分训练出来的模型天然倾向于给出让人满意的答案,流畅、自信、看起来有帮助。于是当它不知道答案时,它更倾向于编一个像样的,而非承认无知。这就是幻觉屡禁不止的训练侧原因,结构侧的原因下一节讲。明白了这一点,你也就能理解为什么"允许 AI 说不知道"这句提示词有效,第四章会讲到。
旁 注业内有一个说法:生成式 AI 更像是被培育出来的,而不是被建造出来的。传统软件的每一个行为都是人写的,大模型却更像种一株植物,你能控制浇水、光照和支架(数据、算力、训练方法),却控制不了它长出的确切形状。它内部的几万亿个旋钮,没有任何人能逐个读懂。我们第一次大规模使用一种自己无法完全看透的造物,它能力惊人的原因在这里,偶尔出人意料的原因也在这里。
训练为什么天价,使用为什么便宜
新闻里说"训练一次花费数亿美元",花掉的就是前面三步,尤其是预训练,上万块 GPU 连续运转数月,电费加上芯片采购费用非常高。
但训练是一次性投入。旋钮一旦调好,日常使用(业内叫推理,Inference)只是让文字流过这套调好的旋钮,成本低得多。
打个比方,培养一位资深专家要二十年寒窗,请他回答一个问题却只要五分钟。训练是那二十年,推理是那五分钟,这就是为什么你每月几十块钱就能用上烧了几亿美元训出来的东西。
但训练是一次性投入。旋钮一旦调好,日常使用(业内叫推理,Inference)只是让文字流过这套调好的旋钮,成本低得多。
打个比方,培养一位资深专家要二十年寒窗,请他回答一个问题却只要五分钟。训练是那二十年,推理是那五分钟,这就是为什么你每月几十块钱就能用上烧了几亿美元训出来的东西。
Scaling Law(规模定律)— 为什么 AI 越来越强模型参数越多、训练数据越大、算力越强,模型就越聪明。这条经验规律目前仍然成立,而且提升是可预测的,投入每增加一个数量级,模型的认知能力就平稳上一个台阶。业内有种说法,再往上一个数量级,差不多相当于本科生和博士生之间的差距。它也解释了各大公司为什么不惜烧掉数十亿美元购买 GPU,在这个阶段,堆资源确实能换来性能提升。
旁 注这条定律有一个反直觉的推论。每过一段时间就有新闻说"训练成本暴降",那是不是意味着大公司可以少花钱了?恰恰相反,省下来的钱会全部投回去训练更强的模型,因为规模定律仍在生效,没人愿意在竞争中停下来。所以成本下降真正改变的是同样的钱能买到多少智能,投入总量并不会因此缩水。
当然,暴力堆资源也不是唯一的路,训练方法、数据质量、架构创新同样关键。资源重要,怎么用资源同样重要。
当然,暴力堆资源也不是唯一的路,训练方法、数据质量、架构创新同样关键。资源重要,怎么用资源同样重要。
两个延伸概念:蒸馏、推理训练
蒸馏(Distillation),大模型教小模型。训练一个顶级大模型极贵,但让一个训好的大模型当老师,给海量问题写出标准答案,再让一个小模型当学生照着学,小模型就能以极低的成本学到老师在特定领域的大部分本事。近两年小模型进步飞快主要靠它,第三章要讲的"把模型装进手机"也以此为技术前提。
推理训练,让模型先打草稿再作答。这是 2025 年以来最重要的训练进展,在数学、代码这类有标准答案的任务上,让模型把思考过程一步步写出来,做对了给奖励。几轮下来,模型自己涌现出了拆解问题、反思、验算的习惯。你在一些产品里看到 AI 答题前先"思考"几十秒,就是这条路线的产物,DeepSeek 的 R 系列是代表之一。
推理训练,让模型先打草稿再作答。这是 2025 年以来最重要的训练进展,在数学、代码这类有标准答案的任务上,让模型把思考过程一步步写出来,做对了给奖励。几轮下来,模型自己涌现出了拆解问题、反思、验算的习惯。你在一些产品里看到 AI 答题前先"思考"几十秒,就是这条路线的产物,DeepSeek 的 R 系列是代表之一。
旁 注训练方法一变,模型的表现就会跟着变。这也是同一家产品每次版本更新都可能让人觉得"手感不一样"的原因:它不像传统软件那样只在旧功能上叠加新功能,每一代都是重新调过的一整套旋钮,某些方面变强的同时,另一些方面可能会退一点。
Anthropic 的 Claude 就是现成的例子。Opus 4.6 的文风偏松弛,写长文、改稿子的时候语感更好;到了 Opus 4.7 和 4.8,编码和长任务执行明显更强,写出来的中文却略硬一些。所以"新版本一定更好"并不总是成立,选哪一版,要看你主要拿它干什么。
Anthropic 的 Claude 就是现成的例子。Opus 4.6 的文风偏松弛,写长文、改稿子的时候语感更好;到了 Opus 4.7 和 4.8,编码和长任务执行明显更强,写出来的中文却略硬一些。所以"新版本一定更好"并不总是成立,选哪一版,要看你主要拿它干什么。
一句话总结模型是训练出来的,不是编程出来的。它学到的是"什么样的回答像一个好回答",而非一条条规则。它的强,理解和举一反三,来自这里;它的弱,幻觉和不稳定,也来自这里。下一节就来看这些强和弱。
03 这颗大脑的性格与短板 — 幻觉 · 左右脑 · 上下文窗口
比喻一:AI 的记忆像人脑,记大意,忘细节
构造和训练都看完了,再来看这颗大脑的"性格"。它有自己的能力边界,有些事做得很好,有些事天生做不好。
你读完一篇 3000 字的新闻,合上手机能复述个大概意思,但具体数字、人名、日期大概率记不全了。
LLM 做的事情跟这很像。当你给它一份几万字的财报让它分析风险,它并不会像 Excel 一样逐格读取每个数字,而是先把整份文件读懂成一段理解,再从这段理解里生成答案。那些不够显眼的数字、犄角旮旯的备注,很可能在理解的过程中就丢掉了。
你读完一篇 3000 字的新闻,合上手机能复述个大概意思,但具体数字、人名、日期大概率记不全了。
LLM 做的事情跟这很像。当你给它一份几万字的财报让它分析风险,它并不会像 Excel 一样逐格读取每个数字,而是先把整份文件读懂成一段理解,再从这段理解里生成答案。那些不够显眼的数字、犄角旮旯的备注,很可能在理解的过程中就丢掉了。
这就是 AI 幻觉的根源你问它"第三季度利润是多少",它大概率答得对,因为这是文档里的显著信息。但你追问"第三季度利润比第二季度低的那个子公司叫什么",它很可能编一个出来。这算不上欺骗,那个细节在理解与压缩的过程中已经丢失,AI 只能用统计概率去补全。再叠加上一节讲的人类反馈训练,它被训练得倾向于给出让人满意的答案,编造就更难避免了。
旁 注这跟人脑的运作方式很像。你读完一本 300 页的书,能讲出核心观点,但第 147 页的那个脚注呢?早在理解的过程中就被大脑自动过滤掉了。AI 处理信息的方式与此相似,理解力强,同样会记大意、丢细节。这算不上 bug,是这类技术天生的特点。
结构性根源AI 通过理解来处理信息,而理解的本质就是有选择地压缩,压缩必然伴随信息损失。这就是幻觉的结构性根源,模型变大能缓解,却不能消除。
减少幻觉的三个实用技巧给 AI 一条退路。在指令里明确写上"如果你不确定,请直接说不知道",授权它可以不知道之后,编造的概率会显著降低。
要求先引用再回答。让 AI 先从原文中找到相关段落,再基于引用内容作答,这样它有据可依,不至于凭空构建。
用 RAG 开卷答题。把相关资料直接提供给 AI,上传文档或者接入 RAG 都行,让它基于真实材料回答,而非只靠训练时的记忆。详见术语词典中的 RAG 条目。
要求先引用再回答。让 AI 先从原文中找到相关段落,再基于引用内容作答,这样它有据可依,不至于凭空构建。
用 RAG 开卷答题。把相关资料直接提供给 AI,上传文档或者接入 RAG 都行,让它基于真实材料回答,而非只靠训练时的记忆。详见术语词典中的 RAG 条目。
比喻二:它只有右脑,没有左脑
左脑管逻辑、规则、精确计算,处理的是符号;右脑管直觉、联想、模式识别,处理的是印象。
过去几十年的所有软件,Excel、数据库、搜索引擎,都是左脑的产物,精确、可预测、不犯创意性错误。
LLM 的出现相当于右脑能力的突破。它能理解模糊意图、跨领域联想、写诗、写代码、共情,但它会用右脑的方式处理所有问题,包括那些本该交给左脑的事。
过去几十年的所有软件,Excel、数据库、搜索引擎,都是左脑的产物,精确、可预测、不犯创意性错误。
LLM 的出现相当于右脑能力的突破。它能理解模糊意图、跨领域联想、写诗、写代码、共情,但它会用右脑的方式处理所有问题,包括那些本该交给左脑的事。
一个常见的"反常现象"AI 能写出一篇结构完整的年终总结,却没法把文档里所有"的"准确替换成"de";能分析一篇英文论文的论证逻辑,却可能在数"这段话里有几个'的'字"上频繁出错。问题出在能力结构而非智力,它的右脑很发达,左脑却接近空白。
左右脑能不能协作?这件事正在发生。
让 AI 遇到数学题时调计算器、需要数据时查数据库、要验证结果时跑一段代码,就是让右脑在需要的时候借用左脑工具。
怎么把这些左脑工具接到 AI 身上?这是第二章要讲的 MCP 和 API。
让 AI 遇到数学题时调计算器、需要数据时查数据库、要验证结果时跑一段代码,就是让右脑在需要的时候借用左脑工具。
怎么把这些左脑工具接到 AI 身上?这是第二章要讲的 MCP 和 API。
上下文窗口与 Token
上下文窗口就是 AI 的工作记忆。你做一个复杂项目时,需要同时记住目标是什么、做到哪一步了、中间结论是什么、接下来该干嘛,AI 也一样,它的所有记忆都存在上下文窗口里,窗口有多大,它就能处理多复杂的任务。
旁 注上下文窗口就像一块有限的白板。白板越大,能同时写下的推理步骤越多,处理的任务也越复杂。要是有人不断往白板上贴大海报,比如大量截图,之前的推理思路和关键数据就会被遮住。记住这块白板,第二章讲 Computer Use 时它是主角。
上下文窗口有三个关键用途。
理解你的需求。你说的话、上传的文档、提供的背景信息全部放在这里,窗口太小,AI 连你的需求都看不完。
记住做到哪了。复杂任务里前面的结果和决定也存在这里,AI 做到第 10 步还能记得第 1 步的结论,靠的就是上下文窗口。
存放工具返回的结果。AI 查资料、调工具之后,返回的内容同样占这块地方,用的工具越多,消耗越大。
所以上下文窗口是 AI 最宝贵的资源,每一点空间都应该用在有价值的信息上。
Token 又是什么?AI 处理文字时会把它切成更小的块,这些块就叫 Token。中文约 1 字 ≈ 1-2 Token,英文约 1 个词 ≈ 1-2 Token。API 按 Token 收费,可以理解成 AI 的流量费,上下文窗口的大小也以 Token 为单位衡量。
理解你的需求。你说的话、上传的文档、提供的背景信息全部放在这里,窗口太小,AI 连你的需求都看不完。
记住做到哪了。复杂任务里前面的结果和决定也存在这里,AI 做到第 10 步还能记得第 1 步的结论,靠的就是上下文窗口。
存放工具返回的结果。AI 查资料、调工具之后,返回的内容同样占这块地方,用的工具越多,消耗越大。
所以上下文窗口是 AI 最宝贵的资源,每一点空间都应该用在有价值的信息上。
Token 又是什么?AI 处理文字时会把它切成更小的块,这些块就叫 Token。中文约 1 字 ≈ 1-2 Token,英文约 1 个词 ≈ 1-2 Token。API 按 Token 收费,可以理解成 AI 的流量费,上下文窗口的大小也以 Token 为单位衡量。
主流模型的上下文窗口
截至 2026 年 6 月窗口越大,AI 能处理的任务越复杂。下面是几个代表性数字,这个领域几个月就会刷新一轮,看个量级就好。
| 模型 | 公司 | 上下文窗口 | 约等于 | 大陆可用 |
|---|---|---|---|---|
| GPT-5.5 | OpenAI | 400K(ChatGPT)/ 1M(API) | ≈ 30-75 万字 | 需科学上网 |
| Gemini 3.5 Pro | 2M Token | ≈ 150 万字 / 3000 页 | 需科学上网 | |
| Claude Fable 5 / Opus 4.8 | Anthropic | 200K-1M Token | ≈ 15-75 万字 | 需科学上网 |
| DeepSeek V4 | DeepSeek | 1M Token | ≈ 75 万字 | 可用 |
第二章 Agent 篇 — 从聊天到干活
这一轮 AI 真正的跃迁在于,它开始能动手了。
04 什么是 AI Agent — 大脑 · 手脚 · 记忆
Agent 到底和聊天有什么不同
前言里看到了很多 Agent 的真实案例,约会议、整理文件、做报价系统、做舆情监测。这些事情跟"和 AI 聊天"有什么本质区别?
区别在一个词,自主性。聊天机器人是你问一步它走一步,Agent 则是你给一个目标,它自己拆解、执行、验证,一路推到出结果。
Anthropic 曾让 Claude 运营一家真实的自动售货小店,选品、定价、联系供应商、跟顾客讨价还价全都自己来。第一期效果不好,模型能力和工具都不到位;第二期换上更强的模型和工具之后,经营走上了正轨。同一个任务,大脑和手脚的配置不同,结果可以完全不同。
区别在一个词,自主性。聊天机器人是你问一步它走一步,Agent 则是你给一个目标,它自己拆解、执行、验证,一路推到出结果。
Anthropic 曾让 Claude 运营一家真实的自动售货小店,选品、定价、联系供应商、跟顾客讨价还价全都自己来。第一期效果不好,模型能力和工具都不到位;第二期换上更强的模型和工具之后,经营走上了正轨。同一个任务,大脑和手脚的配置不同,结果可以完全不同。
Agent 的工作流程
具体来说,Agent 拿到一个目标后的典型工作方式是规划步骤 → 调用工具执行 → 检查结果 → 决定下一步,循环往复,直到完成交付。整个过程中你不需要逐步指挥,只要在关键节点确认方向。
01你的指令"帮我做个网站"
02规划拆成 5 步
03调工具写代码、读文件
04自检测试、修 bug
05交付可运行的网站
Agent 的三个支柱
如果把 Agent 想象成一个人,它由三个部分组成:大脑(模型)、手脚(工具)、记忆(上下文)。市面上所有 Agent 产品,不管叫什么名字、套什么界面,拆开都是这三样。
大脑就是 LLM,负责推理、理解和决策,模型越强 Agent 越聪明,这是第一章讲过的;手脚是工具调用能力,让 Agent 能连接外部世界、真正动手做事,本章第 5、6 节会详讲;记忆是上下文窗口,让 Agent 记住进度和目标,窗口越大能处理的任务越复杂,第一章第 3 节也讲过了。
大脑就是 LLM,负责推理、理解和决策,模型越强 Agent 越聪明,这是第一章讲过的;手脚是工具调用能力,让 Agent 能连接外部世界、真正动手做事,本章第 5、6 节会详讲;记忆是上下文窗口,让 Agent 记住进度和目标,窗口越大能处理的任务越复杂,第一章第 3 节也讲过了。
模型决定上限任何 Agent 产品,核心都是里面那个模型。模型不够强,给它再多工具也没用。外面那层壳可以一个周末写出来,训练一个顶级模型却要数亿美元和数万块 GPU,壁垒不在壳上,在里面。
Agent 用来思考和推理的是文字模型 LLM。当任务涉及图片或视频时,Agent 会接入专门的生图、生视频模型,不同任务调不同模型,Agent 负责调度,你只管提需求。
Agent 用来思考和推理的是文字模型 LLM。当任务涉及图片或视频时,Agent 会接入专门的生图、生视频模型,不同任务调不同模型,Agent 负责调度,你只管提需求。
为什么 Agent 让人兴奋,又为什么现在还不够好
Agent 的意义在于,AI 不再只是回答问题,它能动手执行了。以前你问 AI 一个问题,它给你一段文字,执行仍然是你自己的事;Agent 改变了这个边界,你给它一个目标,它自己去找路、找工具,一路干到出结果。
不过"方向对"和"现在就好用"是两回事,目前把 Agent 当全能管家还有不少现实问题。
不过"方向对"和"现在就好用"是两回事,目前把 Agent 当全能管家还有不少现实问题。
| 问题 | 具体表现 |
|---|---|
| 看屏幕操作成本高 | 没有接口的软件只能靠截图理解界面,比直连数据通道慢且贵(下一节详细讲) |
| 费用不低 | 用强模型且不做优化,日常使用费用可达 $10-20/天 |
| 不够稳定 | 复杂任务容易卡住、崩溃、做到一半迷失方向 |
| 安全隐患 | 它拥有你电脑的完整操作权限,删错文件、覆盖数据的事故真实存在 |
| "装好了,然后呢?" | 大多数人装完后不知道该让它干什么,任务太大太模糊,它根本完不成 |
旁 注为什么有的事 Agent 做得很顺,有的事就卡住?关键在接口。有完整程序接口(API)的软件,AI 可以直接读取数据、直接执行操作,全程走数据通道;没有接口的软件,AI 只能看屏幕、点按钮,又慢又容易错。
同一个大脑,接口决定了它能不能进场。这也是为什么前言里的案例有的很顺利(Blender、Figma 都有现成接口),有的则需要更多配置。大脑决定上限,接口决定入场资格。
同一个大脑,接口决定了它能不能进场。这也是为什么前言里的案例有的很顺利(Blender、Figma 都有现成接口),有的则需要更多配置。大脑决定上限,接口决定入场资格。
好消息是越来越多传统软件正在开放接口。已经有人在用 Agent 做量化交易的因子挖掘、自动化投研分析这类需要大量接口配合的工作,这在两年前还是纯粹的程序员领域。接口越开放,Agent 能做的事就越多。
小结Agent 的基本结构是大脑(模型)加手脚(工具)加记忆(上下文)。接下来看手脚的两种实现方式,Computer Use 和 API/CLI/MCP,你就能理解为什么有些事 AI 做得来、有些做不来。
05 Computer Use — 让 AI 像人一样用电脑,进展与边界
什么是 Computer Use
Computer Use 指的是 Agent 像人一样操作电脑,看屏幕、移鼠标、点按钮、打字,不需要 API 接口,直接看屏幕操作。
先澄清一个常见误解。Computer Use 是一种能力,并非某个产品的专属功能,Anthropic、OpenAI、Google 都有自己的方案,理论上任何 Agent 都能用,市面上那些号称能替你操作电脑的"AI 助理"产品靠的就是它。不过有一个前提贯穿始终,操作桌面应用时依然要靠截图识别,后面的优点和代价都从这里来。
先澄清一个常见误解。Computer Use 是一种能力,并非某个产品的专属功能,Anthropic、OpenAI、Google 都有自己的方案,理论上任何 Agent 都能用,市面上那些号称能替你操作电脑的"AI 助理"产品靠的就是它。不过有一个前提贯穿始终,操作桌面应用时依然要靠截图识别,后面的优点和代价都从这里来。
01截屏拍一张当前屏幕
02识别视觉模型看懂内容
03决策决定点哪/输入什么
04执行模拟鼠标键盘操作
05再截屏循环往复
2026 年它进展到哪了
Computer Use 是过去一年进步最快的方向之一,最有代表性的例子是 OpenAI 的 Codex 桌面版。Agent 用一个自己的光标在你的电脑上看、点、打字,速度相当快,而且是在后台进行,几个 Agent 同时在你电脑上干活,互不干扰,也不耽误你自己用别的软件,你甚至可以用手机远程指挥它。"AI 替你点鼠标"第一次从发布会演示变成了日常可用的功能。
能力上也有了硬指标。在 OSWorld(一个让 AI 完成真实桌面任务的标准化测试)里,2026 年初最强的模型得分已经追平了人类基准线,72% 左右,而一年前最好的成绩还不到一半。
能力上也有了硬指标。在 OSWorld(一个让 AI 完成真实桌面任务的标准化测试)里,2026 年初最强的模型得分已经追平了人类基准线,72% 左右,而一年前最好的成绩还不到一半。
旁 注但同一批研究还测出另一个数字:即使是最强的 Agent,完成同一个任务所用的步骤数也接近人类的三倍。能做到了,却绕了远路,原因在下面两个结构性成本。
结构性成本一:GUI 是给人设计的,不是给 Agent 设计的
你手机上的 App、电脑上的软件,所有按钮、菜单、下拉框、滚动条、弹窗,这些统称 GUI(图形用户界面)。
GUI 的每一个设计决策都是为人类的眼睛和手指优化的:按钮要足够大,人手指才点得到;颜色对比要够强,人眼才看得清;还有鼠标悬停才显示的提示信息,以及拖拽排序、长按弹出菜单、双指缩放。
这些交互方式对人类来说很自然,对 AI 来说却全是障碍。
GUI 的每一个设计决策都是为人类的眼睛和手指优化的:按钮要足够大,人手指才点得到;颜色对比要够强,人眼才看得清;还有鼠标悬停才显示的提示信息,以及拖拽排序、长按弹出菜单、双指缩放。
这些交互方式对人类来说很自然,对 AI 来说却全是障碍。
旁 注AI 天生的母语是文字,最擅长处理明确的文字指令。但 GUI 把所有信息都画成了图形,按钮、图标、弹窗,AI 不得不先对着截图猜哪里是按钮、哪里是输入框。用文字一秒搞定的事,换成看图就变成了猜谜游戏,这中间的信息损耗是结构性的。
想象一下这个场景。你不得不远程办公,新来的同事需要完成一个任务,找你请教,但你们没法快速对话,你告诉他术语他理解不了,只能靠他截图发给你、你在截图上标注"点这里"、他再截图确认,这样一步步推进,每换到一个新界面都要重新截一轮。
对人类来说这种沟通方式已经非常低效,对 Agent 来说更糟。失去 API 接口就像你不在办公室,没法当面快速沟通,Agent 只能靠截图来理解界面,而每一张截图都在烧它的大脑(消耗模型 Token),占用它的记忆(上下文窗口)。
对人类来说这种沟通方式已经非常低效,对 Agent 来说更糟。失去 API 接口就像你不在办公室,没法当面快速沟通,Agent 只能靠截图来理解界面,而每一张截图都在烧它的大脑(消耗模型 Token),占用它的记忆(上下文窗口)。
人类操作 GUI
看到按钮 → 手指点击
看到下拉菜单 → 选择选项
看到弹窗 → 理解上下文后操作
整个过程 0.5 秒,自然流畅
AI 操作 GUI
截屏 → 上传图片 → 视觉模型识别 → 猜测按钮位置坐标 → 发送点击指令 → 等待渲染 → 再截屏确认
2026 年已经快了很多,但每一步仍要走完这个多环节循环,步骤数接近人类的三倍
核心矛盾软件先把结构化数据渲染成像素图像给人看,Computer Use 再试图从像素中逆向还原出数据。翻译了一遍再翻译回来,信息只会越来越少。与其在像素层反复猜测,不如直接把数据交给 AI,这正是下一节 MCP 和 API 的思路。
结构性成本二:截图识别造成上下文污染
Computer Use 的工作方式是每做一步操作,就截一张屏幕图片发给 AI 模型。
问题在于 AI 的记忆(上下文窗口,第一章第 3 节讲过)是有限的。每张截图大约消耗 1000-2000 个 Token,一个 10 步操作就是 10 张截图,占用 1-2 万 Token。截图越多,AI 越容易忘记最初的目标和中间步骤,错误持续累积,成本飙升,速度极慢,信噪比一路恶化,AI 越操作越糊涂、越贵、越慢。
问题在于 AI 的记忆(上下文窗口,第一章第 3 节讲过)是有限的。每张截图大约消耗 1000-2000 个 Token,一个 10 步操作就是 10 张截图,占用 1-2 万 Token。截图越多,AI 越容易忘记最初的目标和中间步骤,错误持续累积,成本飙升,速度极慢,信噪比一路恶化,AI 越操作越糊涂、越贵、越慢。
一句话总结Computer Use 每操作一步就往 AI 的记忆里塞入一张高成本低信息量的截图。问题不在 AI 的智商,而在于这种方法本身就是赔本买卖,花大价钱处理低质量信息。
Computer Use 的定位(2026 年年中)能力已经追平人类基准线,体验也做到了日常可用,但像素翻译的信息损耗、三倍步骤的效率差、截图对上下文的污染,这些结构性问题仍然存在。
实用结论是:有数据通道就优先走数据通道(下一节的 API、CLI、MCP),没有接口的软件再让 Agent 看屏幕操作。这个判断不用你来做,告诉 Agent 你要什么,它自己会选路。
实用结论是:有数据通道就优先走数据通道(下一节的 API、CLI、MCP),没有接口的软件再让 Agent 看屏幕操作。这个判断不用你来做,告诉 Agent 你要什么,它自己会选路。
06 给 Agent 装上手和脚 — API · CLI · MCP
为什么 Agent 需要"手和脚"
Agent 需要能做事的手段,上一节的 Computer Use 是其中成本最高的方式,靠像素级模拟人类操作。更好的方式有三种,它们全部走文字数据通道。
01API最精准
02CLI最现成
03MCP最通用
04Computer Use最后手段
旁 注你想拿到同事电脑上的一份文件。
API 是同事直接把文件发给你,秒到,原封不动,但每个人发文件的方式不同,有人用微信,有人发邮件,有人丢网盘链接,你得一个个去适配。
CLI 是同事的电脑上有个文字对讲窗口,你打一行字"把 X 文件发我",它立刻照办,而这个窗口几十年前就装好了,只是以前只有内行知道怎么喊话。
MCP 是同事把文件传到了公司的云端服务器上,你登录后直接下载,公司内所有人都通过这个方式共享文件,统一入口,一种方式搞定所有人。
Computer Use 是同事把文件打开在他的屏幕上,你举起手机对着他的屏幕拍了一张照,然后从照片里去辨认上面写了什么。
API 是同事直接把文件发给你,秒到,原封不动,但每个人发文件的方式不同,有人用微信,有人发邮件,有人丢网盘链接,你得一个个去适配。
CLI 是同事的电脑上有个文字对讲窗口,你打一行字"把 X 文件发我",它立刻照办,而这个窗口几十年前就装好了,只是以前只有内行知道怎么喊话。
MCP 是同事把文件传到了公司的云端服务器上,你登录后直接下载,公司内所有人都通过这个方式共享文件,统一入口,一种方式搞定所有人。
Computer Use 是同事把文件打开在他的屏幕上,你举起手机对着他的屏幕拍了一张照,然后从照片里去辨认上面写了什么。
API:程序之间的"插座"
API 就是软件留给其他程序的快捷通道。
你平时可能没注意,但你用的每个 App 背后都有 API。比如你在淘宝下单后,物流信息自动出现在支付宝里,淘宝和快递公司之间就是通过 API 互通数据的。微信支付、高德导航嵌入到各种 App 里,走的也是 API。
你平时可能没注意,但你用的每个 App 背后都有 API。比如你在淘宝下单后,物流信息自动出现在支付宝里,淘宝和快递公司之间就是通过 API 互通数据的。微信支付、高德导航嵌入到各种 App 里,走的也是 API。
旁 注GUI 就是同事屏幕上显示的那个画面,字体清晰、排版好看,专门给人眼看的。API 则是直接把背后的原始文件发过来,跳过一切视觉包装,数据直达。
AI 通过 API 操作软件,要的就是那份原始文件,而不是对着屏幕拍照再猜。
AI 通过 API 操作软件,要的就是那份原始文件,而不是对着屏幕拍照再猜。
API 的好处很直观:数据直接传输,不需要看屏幕猜;速度快到眨眼就完成;不用处理图片,费用因此低得多;结果确定,不会看错。局限也同样明确,它需要软件厂商主动开放接口,而每家的 API 格式又各不相同,对接起来相当麻烦,国内很多软件至今不开放 API。
CLI:电脑里现成的"文字遥控器"
CLI(Command Line Interface,命令行接口)是软件的文字操作通道,你输入一行文字指令,软件直接执行并用文字回应。
这不是什么新发明,恰恰相反,它是计算机世界里最老的接口。过去几十年,程序员给几乎所有重要的软件都留了命令行通道,处理视频的 ffmpeg、管理代码的 git、转换图片的工具、还有操作系统本身的全部功能,这些工具不开 GUI 窗口、没有按钮,全靠一行行文字指令驱动。
过去这是程序员的专属领地,但 AI 时代它突然变成了一座现成的金矿。CLI 全是文字,而文字是 AI 的母语,对 Agent 来说每一个有 CLI 的软件都等于一个不用任何改造就能直接调用的工具。这就是为什么 Claude Code 这类 Agent 装好就什么都能干,剪视频、转格式、批量改文件名,它调用的正是你电脑里那些积累了几十年的命令行工具。
这不是什么新发明,恰恰相反,它是计算机世界里最老的接口。过去几十年,程序员给几乎所有重要的软件都留了命令行通道,处理视频的 ffmpeg、管理代码的 git、转换图片的工具、还有操作系统本身的全部功能,这些工具不开 GUI 窗口、没有按钮,全靠一行行文字指令驱动。
过去这是程序员的专属领地,但 AI 时代它突然变成了一座现成的金矿。CLI 全是文字,而文字是 AI 的母语,对 Agent 来说每一个有 CLI 的软件都等于一个不用任何改造就能直接调用的工具。这就是为什么 Claude Code 这类 Agent 装好就什么都能干,剪视频、转格式、批量改文件名,它调用的正是你电脑里那些积累了几十年的命令行工具。
CLI 和 API 怎么区分?本质上是一回事,都是跳过图形界面、用结构化文字跟软件对话。习惯上的区分在于,API 走网络,调用云端服务,需要厂商开放;CLI 在本机,调用你电脑上装好的软件,几十年的存量工具拿来就用。对 Agent 来说,CLI 最大的优势是现成,不用等任何厂商表态,金矿已经在那里了。第三章会带你亲手打开这扇门。
MCP:AI 世界的"Type-C"
MCP(Model Context Protocol,模型上下文协议)最初由 Anthropic 在 2024 年底推出,2025 年 12 月捐赠给 Linux Foundation 旗下的 Agentic AI Foundation,成为行业级的开放标准,OpenAI、Google、Microsoft、Amazon 等巨头全部加入。它解决的核心问题是:每个软件的 API 格式都不一样,Agent 怎么统一对接?
旁 注回忆一下你用过的各种充电线,安卓有 Micro USB、苹果有 Lightning、新设备用 Type-C,每换一个品牌就得换一根线。API 的现状也是如此,飞书的 API 是一种格式、钉钉是另一种、Google Calendar 又是一种,Agent 需要逐一适配。
MCP 就是 AI 世界的 Type-C 统一接口,不管对面是什么软件,接上就能通信。Agent 只需学会 MCP 这一种协议,就能与所有接入 MCP 的软件对话。
MCP 就是 AI 世界的 Type-C 统一接口,不管对面是什么软件,接上就能通信。Agent 只需学会 MCP 这一种协议,就能与所有接入 MCP 的软件对话。
MCP 和 API 到底什么关系?API 是每个软件自己的接口,格式各不相同,飞书长一个样,钉钉又是另一个样,AI 需要逐个适配。MCP 则是在各家 API 之上加了一层统一的翻译协议,AI 只需掌握 MCP 这一种语法,就能与所有接入 MCP 的软件对话,就像普通话是全国通用语言,不管对方是广东人还是东北人,说普通话就能沟通。
顺带一提:RPA你可能听过 RPA(机器人流程自动化)。如果说 Agent 是一个能理解需求、随机应变的员工,RPA 就像一台只会按录好的程序重复动作的流水线机器,你录什么它做什么,中间出了任何意外它就卡住了。这属于上一个时代的自动化方案,正在被 Agent 吸收和替代,了解即可。
不确定该用哪种方式?不用自己判断。直接告诉 Agent 你想做什么,它会自己找最合适的路径,这本来就是 Agent 擅长的事。
试读到此结束
继续阅读完整版
往下是第三章「上手篇」:选工具、装终端、教 Agent 你的做法、把模型装进自己的设备;再往后是心法篇与视野篇,以及 AI 术语词典和海外产品 ↔ 中国大陆平替速查表两篇附录。
完整版 · 5 章 14 节 + 2 篇附录 · PDF + EPUB 双格式
零基础友好 · 迭代 20+ 版 · 贴合国内环境 · 即买即下载