Type AI
Created May 23, 2026, 08:05:00 / Updated May 23, 2026, 08:05:00
Views — / Comments — / Words 2,800
AI核心概念
LLM (Large Language Model),全称大语言模型,简称大模型。 底层引擎: Transformer 架构 架构提出时间:2017 年 论文出处:Google 团队发布的《Attention Is All You Need》 | 时间 | 里程碑 | 意义 | |------|--------|...
LLM(Large Language Model),全称大语言模型,简称大模型。
| 时间 | 里程碑 | 意义 |
|---|---|---|
| 2017 年 | Transformer 架构提出 | Google 发明的”火种” |
| 2022 年 11 月 | GPT-3.5 发布 | 第一个达到可用级别的大模型 |
| 2023 年 3 月 | GPT-4 发布 | 将 AI 能力天花板拉到新高度 |
| 至今 | GPT-4o/5.4 等 | 持续迭代,业界标杆 |
大模型本质是一个文字接龙游戏:
用户输入 → 模型预测下一个概率最高的词 → 吐出词 → 抓回追加 → 继续预测 → 循环直到结束
具体示例:
这就是为什么大模型要一个词一个词地输出答案。
Token 是大模型处理文本的最基本单元。
编码(文字→数字) 解码(数字→文字)
用户输入 ──→ Token 切分 ──→ Token ID 映射 ──→ 模型处理 ──→ 输出 Token ID ──→ Token 映射 ──→ 文字输出
编码环节(两步):
解码环节:
Token ≠ 词,两者没有明确的对应关系。
中文示例:
| 输入文本 | 预期切分 | 实际切分 |
|---|---|---|
| 我的频道叫Khuatcoung工作坊 | 4 个词 | 5 个 Token(“工作坊”被拆成”工作”+“坊”) |
| 程序员 | 1 个词 | 2 个 Token(“程序”+“员”) |
英文示例:
| 单词 | Token 数量 | 说明 |
|---|---|---|
| hello | 1 个 | 常见单词恰好对应 |
| going | 1 个 | 常见单词恰好对应 |
| helpful | 2 个 | 拆分为”help”+“ful” |
| 对勾符号 | 3 个 | 无显示字符,用 Token ID 更直观 |
| 语言类型 | 平均一个 Token 等于 |
|---|---|
| 英文单词 | 约 0.75 个 |
| 中文汉字 | 约 1.5~2 个 |
示例:
Context(上下文)= 大模型每次处理任务时接收到的信息总和
可以把它看作大模型的临时记忆体,包含:
Context Window(上下文窗口)= Context 能够容纳的最大 Token 数量
| 模型 | Context Window |
|---|---|
| GPT-4o | 105 万 Token |
| Claude 3.1 Pro | 100 万 Token |
| Claude Opus 4.6 | 100 万 Token |
100 万 Token ≈ 150 万汉字 ≈ 整部《哈利波特》全集
当需要处理超过 Context Window 限制的文档时,使用 RAG(Retrieval-Augmented Generation)技术:
用户问题 → 从长文档中检索最相关的片段 → 只把相关片段发给大模型 → 大模型回答
优点:
Prompt = 给大模型的具体问题或指令
研究如何把话说清楚,让大模型更精准理解意图。
现状:门槛较低 + 大模型能力越来越强 → 这个概念已较少被单独提及
| 类型 | 中文名 | 来源 | 作用 |
|---|---|---|---|
| User Prompt | 用户提示词 | 用户在对话框输入 | 说明具体任务 |
| System Prompt | 系统提示词 | 开发者在后台配置 | 说明人设和做事规则 |
示例场景:数学辅导机器人
System Prompt(开发者配置,用户看不到):
你是一个耐心的数学老师,当学生问你数学问题的时候,
不要直接给出答案,而是要一步一步引导学生思考,
帮助他们理解解题思路。
User Prompt(用户输入):
3加5等于几?
大模型的响应(受 System Prompt 影响):
我们可以这样想,你手里有三个苹果,然后又拿了5个,
现在一共有多少个呢?你可以数一数看。
如果没有 System Prompt,大模型可能直接回答”8”。
大模型的弱点:无法感知外界环境,无法获取实时信息。
示例:
问:今天上海的天气怎么样?
答:抱歉,我无法获取实时天气信息,我的知识库截止到某年某月...
Tool = 函数(Function)
输入 → Tool(内部操作,如调用 API) → 输出
天气查询工具示例:
输入:城市、日期
处理:调用气象局接口
输出:天气信息
涉及角色:
| 角色 | 职责 |
|---|---|
| 用户 | 发起问题 |
| 大模型 | 选择工具、生成参数、归纳总结 |
| 平台 | 传话筒,串联整个流程,实际调用工具 |
| 工具 | 执行具体操作(如查天气) |
流程图:
1. 用户问题 → 平台 → 大模型(附带可用工具列表)
↓
2. 大模型分析 → 发现需要天气信息 → 生成工具调用指令(工具名+参数)
↓
3. 工具调用指令 → 平台 → 实际调用工具 → 获取结果
↓
4. 工具结果 → 大模型 → 整理成人话
↓
5. 整理后的回答 → 平台 → 用户
关键点:大模型无法自己调用工具,它只能输出文本告诉平台想调用什么工具,实际调用由平台完成。
在 Tool 接入平台时,每个平台的规范不同:
| 平台 | 接入规范 |
|---|---|
| ChatGPT | OpenAI 规范 |
| Claude | Anthropic 规范 |
| Gemini | Google 规范 |
问题:同一个工具要写三遍接入代码。
MCP(Model Context Protocol)= 统一的工具接入标准
作用:工具开发者只需按照 MCP 规范开发一次,该工具即可被所有支持 MCP 的平台使用。
类比:所有手机都用 Type-C 接口,统一标准,方便所有人。
Model Context Protocol = 模型上下文协议
Agent = 能够自主规划、自主调用工具、持续工作直到完成用户任务的系统。
| 概念 | 特点 |
|---|---|
| Tool | 单次调用 |
| Agent | 多步规划 + 多次调用 + 持续运作 |
用户问题:
今天我这里的天气怎么样?如果下雨的话,
帮我查一下附近有没有卖雨伞的店。
可用工具:
Agent 的思考与执行流程:
1. 分析:用户问天气 → 需要知道位置 → 调用定位工具
↓
2. 获取经纬度:-74°(经度), 40°(纬度)
↓
3. 分析:有了位置 → 调用天气工具查天气
↓
4. 获取天气:有雨
↓
5. 分析:下雨 + 用户要查雨伞店 → 调用店铺工具
↓
6. 获取结果:附近 100 米有家便利店卖伞
↓
7. 综合所有信息 → 输出最终答案
经典模式包括:ReAct、Plan-and-Execute 等。
即使有 Agent,每次使用仍然需要重复输入大量规则和格式要求:
"我马上要出门,该带些什么呢?"
缺失的信息:
Agent Skill = 提前写好的给 Agent 看的说明文档
┌─────────────────────────────────────────┐
│ 元数据层(Metadata) │
│ - name: go_out_checklist │
│ - description: 出门清单... │
├─────────────────────────────────────────┤
│ 指令层(Instructions) │
│ - 目标 │
│ - 执行步骤 │
│ - 判断规则 │
│ - 输出格式 │
│ - 示例 │
└─────────────────────────────────────────┘
---
name: go_out_checklist
description: 出门清单助手,根据天气提醒用户带好装备
---
# 目标
每次出门前帮用户检查天气并提醒携带物品
# 执行步骤
1. 调用定位工具,获取用户经纬度
2. 调用天气工具,获取天气信息
3. 根据天气数据,按照判断规则整理携带物品
4. 按照输出格式输出结果
# 判断规则
- 下雨 → 戴伞
- 光照强 → 戴帽子
- 空气差 → 戴口罩
- 风大 → 穿防风外套
- 必带 → 手机
# 输出格式
先来一句总结,然后列出物品清单,每个物品带原因
# 示例
用户问题:我马上要出门帮我看看今天要带什么东西
定位工具返回:经度-74,纬度40
天气工具返回:下雨,光照强
期望输出:
"今天天气有点糟糕,记得带这些东西:
- 雨伞(今天有雨)
- 帽子(光照较强)
"
1. 创建文件夹
路径:用户目录/.claude/skills/
文件夹名称 = Agent Skill 名称(如 go_out_checklist)
2. 创建文件
文件名:skill.md(必须大写,这是硬性规范)
3. 将内容粘贴保存
用户提问 → Claude Code 检测到问题与 Agent Skill 相关
↓
读取 Agent Skill 完整内容(指令层)
↓
按 Agent Skill 要求执行步骤
↓
输出符合格式要求的结果
┌──────────────────────────────────────────────────────────────────┐
│ AI 概念层次结构 │
├──────────────────────────────────────────────────────────────────┤
│ │
│ ┌─────────┐ │
│ │ Agent │ ← 能够自主规划、调用工具、持续运作的程序 │
│ └────┬────┘ │
│ │ │
│ ┌────┴─────────────────┐ │
│ │ Agent Skill │ ← 给 Agent 的说明文档 │
│ └────┬─────────────────┘ │
│ │ │
│ ┌────┴────┐ ┌──────────┐ │
│ │ Tool │────→│ MCP │ ← 统一的工具接入标准 │
│ └────┬────┘ └──────────┘ │
│ │ │
│ ┌────┴──────────────────────────┐ │
│ │ LLM(大模型) │ ← 所有 AI 技术的核心 │
│ └────┬──────────────────────────┘ │
│ │ │
│ ┌────┴──────────────────────────┐ │
│ │ Token(最基本处理单元) │ │
│ └────┬──────────────────────────┘ │
│ │ │
│ ┌────┴──────────────────────────┐ │
│ │ Context(临时记忆体) │ ← 包含历史、规则、当前输入 │
│ │ Context Window(容量上限) │ ← 最大 Token 数量 │
│ └───────────────────────────────┘ │
│ │
│ ┌────────────────┐ ┌────────────────┐ │
│ │ System Prompt │ │ User Prompt │ ← Prompt 的两种类型 │
│ └────────────────┘ └────────────────┘ │
│ │
└──────────────────────────────────────────────────────────────────┘
| 概念 | 英文 | 作用 |
|---|---|---|
| LLM | Large Language Model | 大语言模型,AI 核心 |
| Token | Token | 处理文本的最基本单元 |
| Context | Context | 大模型的临时记忆体 |
| Context Window | Context Window | Context 的容量上限 |
| Prompt | Prompt | 给大模型的具体指令 |
| User Prompt | User Prompt | 用户输入的问题 |
| System Prompt | System Prompt | 开发者配置的人设规则 |
| Tool | Tool/Function | 让大模型感知外部环境 |
| MCP | Model Context Protocol | 统一的工具接入标准 |
| Agent | Agent | 自主规划+持续工作的系统 |
| Agent Skill | Agent Skill | 给 Agent 的说明文档 |
Comments
Notes, questions, and follow-ups are welcome here.
Comments are temporarily unavailable because
WALINE_SERVER_URL or PUBLIC_WALINE_SERVER_URLis not configured.