LLM 运行机制:Token、上下文窗口与采样参数怎么影响输出
Token 与窗口不是抽象概念,它们直接决定账单与回答质量。
Token 与窗口
文本切分为 Token;上下文窗口是单次可见上限。多模态输入(图/音)也占 Token。溢出时尾部或中间截断,系统指令可能被挤掉。
采样参数
temperature 越高越发散;top_p 核采样;max_tokens 限制输出。确定性任务低温;创意任务略升温。同一 Prompt 不同参数可 A/B。
成本预算
输入通常比输出便宜;长上下文模型单价更高。Prompt Cache 对重复前缀省钱。预算公式:系统+检索+历史+输出 reserve。
误区
窗口拉满;忽视截断策略;无 max_tokens 导致账单失控。
延伸思考
多模态计费常让人低估:一张高分辨率图可能等价数千 text token。窗口管理上,系统指令应模板化且可缓存;历史对话可 rolling summary;RAG 片段按相关性截断。Prompt Cache 适合固定前缀(系统+工具 schema),变动部分放后缀。预算公式实践:reserve 20% 给 output,检索不超过 40%,历史不超过 30%,其余给指令与 query。监控 dashboard 应展示 input/output token 分布而不只是总量。
实践小结
练习:用 tokenizer 统计典型 Prompt 各段 token 占比。试 Prompt Cache 命中前后延迟差异。设 max_tokens 与 stop sequences 观察截断行为。
工程检查清单
检查清单:token 预算公式;截断策略;temperature 任务映射;Prompt Cache 适用;多模态 token 评估。运行机理理解直接决定成本与质量平衡。
读者 takeaway
读者 takeaway:Token 与窗口是成本与质量的旋钮。理解机理后,才能在「加检索」「加历史」「换长窗模型」之间做理性权衡,而不是暴力堆上下文。

