Token 与窗口不是抽象概念,它们直接决定账单与回答质量。

Token 与窗口

文本切分为 Token;上下文窗口是单次可见上限。多模态输入(图/音)也占 Token。溢出时尾部或中间截断,系统指令可能被挤掉。

采样参数

temperature 越高越发散;top_p 核采样;max_tokens 限制输出。确定性任务低温;创意任务略升温。同一 Prompt 不同参数可 A/B。

成本预算

输入通常比输出便宜;长上下文模型单价更高。Prompt Cache 对重复前缀省钱。预算公式:系统+检索+历史+输出 reserve。

误区

窗口拉满;忽视截断策略;无 max_tokens 导致账单失控。

延伸思考

多模态计费常让人低估:一张高分辨率图可能等价数千 text token。窗口管理上,系统指令应模板化且可缓存;历史对话可 rolling summary;RAG 片段按相关性截断。Prompt Cache 适合固定前缀(系统+工具 schema),变动部分放后缀。预算公式实践:reserve 20% 给 output,检索不超过 40%,历史不超过 30%,其余给指令与 query。监控 dashboard 应展示 input/output token 分布而不只是总量。

实践小结

练习:用 tokenizer 统计典型 Prompt 各段 token 占比。试 Prompt Cache 命中前后延迟差异。设 max_tokens 与 stop sequences 观察截断行为。

工程检查清单

检查清单:token 预算公式;截断策略;temperature 任务映射;Prompt Cache 适用;多模态 token 评估。运行机理理解直接决定成本与质量平衡。

读者 takeaway

读者 takeaway:Token 与窗口是成本与质量的旋钮。理解机理后,才能在「加检索」「加历史」「换长窗模型」之间做理性权衡,而不是暴力堆上下文。

学习建议