1. Token(词元)
定义
大模型处理文本的最小基础单位,不是单纯汉字 / 单词,是模型词表预拆分后的片段,英文、中文拆分规则不同。
换算规则
- 英文:4 个字符 ≈ 1 Token,0.75 个英文单词 ≈ 1 Token
- 中文:1 个汉字 ≈ 1.5~2 Token(中文编码成本更高)
- 符号、空格、标点都会单独占用 Token
核心作用
- 计费标准:所有 LLM API 按输入 Token、输出 Token 分别计价,输出通常更贵
- 长度计量:上下文窗口、最大生成长度全部以 Token 为单位
- 输入过长会触发截断,丢失前文信息
2. 上下文窗口 Context Window
定义
模型单次推理能同时读取、记忆、参考的最大 Token 总容量,等同于模型的短期工作记忆上限。
包含内容
一次请求内全部 Token 总和:历史对话 + 系统提示词 Prompt + 用户当前提问 + 已生成的回答内容。
关键特性
- 硬限制:由模型架构决定(4K/8K/32K/128K / 百万级),无法无限扩容;窗口越大,显存、算力消耗呈平方级上涨
- 溢出处理:Token 总量超限后,最早的对话内容会被截断丢弃,模型彻底遗忘早期信息,出现回答断片、逻辑丢失
- 业务价值:窗口越大,越适合长文档解读、多轮超长对话、代码全文件分析
3. Temperature 温度参数
定义
控制模型生成文字的随机发散程度,取值范围 0.0 ~ 2.0,默认 1.0,底层通过缩放预测分数 logits 调整概率分布。
不同取值效果
- Temperature ≈ 0(0.1~0.3):概率分布极度陡峭,只选最高概率 Token;输出严谨、重复少、无脑洞,适合代码、数学计算、事实问答、数据抽取
- Temperature = 0.5~0.7:平衡稳定与多样性,通用聊天、翻译、普通文案首选
- Temperature ≥ 1.0(1.0~1.5):分布变平缓,低概率词汇更容易出现;创意更强,适合小说、写诗、头脑风暴;过高容易产生幻觉、逻辑混乱
公式原理
调整后概率 = softmax(logits / temperature)
4. Top-p 核采样(Nucleus Sampling)
定义
动态截断候选词池:将所有预测 Token 按概率从高到低累加,只保留累积概率总和达到 p 的词汇集合,其余低概率长尾词直接丢弃。取值 0.0 ~ 1.0,默认 1.0(不截断)。
取值效果
- Top-p=0.1~0.5:仅保留极少数高确信词汇,输出严谨统一,适合专业问答
- Top-p=0.8~0.95:保留绝大多数主流合理词汇,兼顾自然度与多样性,日常对话标配
- Top-p=1:等价不限制候选词,全部词汇参与采样
和 Temperature 区别
- Temperature:整体缩放全部词汇的概率高低,改变随机倾向
- Top-p:直接过滤掉低概率冷门词汇,控制可选词汇范围 工程最佳实践:二者不要同时大幅调高,一般固定一个微调另一个。
5. 流式输出 Stream
定义
SSE(服务器推送事件)流式推理,模型逐 Token 实时返回生成片段,不用等完整回答生成完毕再一次性返回结果。
工作流程
- API 请求开启
stream=True - 服务端每生成 1 个 Token 就推送一条小块数据 chunk
- 客户端持续接收
delta增量文本,实时拼接展示 - 全部生成完成后推送结束标识
优势
- 用户体验:打字机实时效果,消除长时间空白等待
- 低延迟:长回答场景感知速度提升数倍
是否开启流式
绝大多数前端聊天场景:必须开流式(stream=True)
后端批量 / 程序自动化场景:关闭流式(stream=False)
原因:
- 代码逻辑更简单,一次性拿到完整文本,不用循环拼接每一段 chunk;
- 不需要实时展示,后台静默处理,追求简洁代码;
- 要对完整结果做正则、JSON 解析、校验,一次性返回更方便。
特殊工具调用(Function Calling)建议
流式开启:工具调用参数会分段吐出,需要代码拼接完整 JSON 才能解析调用;
流式关闭:直接拿到完整工具调用结构,解析更省事。
如果你的业务大量依赖工具联网、查数据,很多开发者会临时关流式。
Function Calling 函数调用(工具调用)
定义
大模型自主识别用户意图,自动生成外部函数 / API 调用参数,交给开发者本地执行工具,再把工具结果传回模型整合输出自然语言,打通模型与外部真实数据、系统操作的能力。
完整执行四步流程
- 函数注册:开发者定义工具,提供函数名、功能描述、入参 JSON Schema 传给模型
- 意图判断:用户提问后,模型判断是否需要调用外部工具(查天气、数据库、联网搜索)
- 生成调用指令:模型返回标准化函数名 + 结构化参数,不生成自然文本
- 执行回填 + 二次生成:本地代码执行函数拿到结果,将数据塞回上下文,模型结合工具数据给出最终回答
典型应用场景
- 实时信息:天气、股票、新闻、航班查询
- 系统操作:数据库增删查改、设备控制、邮件发送
- 智能 Agent:多工具链式调用、复杂任务自动化
核心价值
解决大模型知识截止、无法访问实时数据、不能操作外部系统三大短板,是智能体 Agent 的底层核心能力。