3.1 KiB
3.1 KiB
基础概念
LLM(Large Language Model)
大型语言模型。通过海量文本数据训练的深度神经网络,能理解和生成自然语言。目前主流如 GPT、Claude、Grok、Llama、Qwen 等。
Token(词元)
LLM 处理文本的最小单位。不是单词,而是子词(subword)或字符片段。
- 英文:1 个 token ≈ 4 个字符 ≈ 0.75 个单词
- 中文:1 个汉字 ≈ 1~2 个 token
- Token 数量直接决定费用和上下文长度。
Context(上下文)
模型在一次推理时能“看到”的全部文本内容,包括历史对话、系统指令、用户输入等。
Context Window(上下文窗口)
模型单次能处理的最大 Token 数量。
常见规格(2026 年):
- GPT-4o / Claude 3.5:200K
- Grok-3 / Gemini 2.0:1M+
- Llama 3.1 405B:128K
超过 Context Window 会发生截断(truncation),导致信息丢失。
Prompt(提示)
用户或系统输入给模型的全部文本,用于引导模型生成期望输出。
User Prompt(用户提示)
用户实际输入的内容(如问题、指令、对话)。
System Prompt(系统提示)
开发者预设的“人格设定 + 规则 + 行为约束”,在对话开始时注入,优先级最高。
作用:定义模型角色、输出格式、禁止事项等。
进阶概念
Tool(工具 / 函数调用)
让 LLM 能调用外部工具(如搜索、代码执行、计算器、数据库等)的能力。
模型先输出工具调用请求 → 执行工具 → 把结果塞回上下文 → 模型继续生成最终答案。
MCP(Model Context Protocol?此处指工具调用相关协议/框架)
(面试中若出现,通常指 Multi-Call Protocol 或特定公司的 Model Control Protocol,但最常见的是指 Tool Calling / Function Calling 的多轮协议)
Agent(智能体)
具备自主性的 LLM 系统。核心特征:
- 能感知环境(Context + Tools)
- 能规划(Planning)
- 能执行(Tool Use)
- 能记忆(Memory)
- 能迭代直到完成复杂目标
典型架构:ReAct、Plan-and-Execute、Multi-Agent 等。
Agent Skill(智能体技能)
Agent 拥有的具体能力,通常通过以下方式实现:
- Tool Use(工具调用)
- Few-shot / Chain-of-Thought 提示
- 代码解释器(Code Interpreter)
- 自定义函数 / API
- 检索增强(RAG)
- 记忆模块(Memory)
面试高频总结一句话版:
- Token 是 LLM 的“货币”和“长度单位”
- Context Window 是模型一次能“记住”多少内容的上限
- Prompt(System + User)是指挥模型的“指令集”
- Tool 是给模型“手和眼睛”
- Agent 是把 Tool + Planning + Memory 组合起来,能自主完成复杂任务的智能体
- Agent Skill 是 Agent 具体会用的各种能力
背诵金句(面试必备): “LLM 本身只会 next-token prediction,要让它真正有用,必须通过 Prompt 引导、Tool 赋予能力、Agent 实现自主规划,最终在 Context Window 内完成任务。”