AI 可观测性与 Trace:如何还原 Agent 的完整执行过程
AI 应用成功返回不等于正确——需要 Trace 还原推理与工具链。 信号分层Metrics:QPS、延迟、Token、错误率。Logs:结构化事件。Trace:跨服务调用树。Evaluation:离线/在线质量。Audit:合规与 tool 调用。 ID 层级Session(用户会话)→ Run(一次任务)→ Trace → Span(LLM/检索/tool)→ Attempt(重试)。Agent 请求拆多 Span 才可定位偏题步。 实践OpenTelemetry 传播 context;头部采样 + 错误尾部必留;关联 prompt_version、model、retrieval_ids。Dashboard 看 TTFT 与 tool 失败率。 误区只 log 最终答案;无 retrieval id 无法查「召回了什么」;采样率 100% 存不下。 延伸思考Agent Span 命名规范示例:llm.chat、retrieval.search、tool.execute、memory.read。Attributes 存 model、prompt...
LLM/Agent 安全实战:从 Prompt Injection、工具越权到沙箱隔离
Agent 能执行工具时,安全面从「说错话」扩展到「做错事」。 威胁模型Prompt Injection(直接/间接);Jailbreak;工具越权;检索泄露未授权文档;供应链(恶意 Skill/MCP)。 防护信任分区:系统指令 vs 用户 vs 外部检索。检索前 ACL;外部 HTML 先提取再入上下文;工具最小权限;写操作确认;沙箱跑代码。 System Prompt 局限「忽略恶意指令」不可靠——需输入过滤、输出策略、工具 allowlist。记录 audit 便于追责。 误区认为 RAG 私有就安全;MCP 连上即信任;无 human-in-the-loop 高危操作。 延伸思考间接注入常来自检索到的网页、邮件、PDF——攻击指令藏在正文里。缓解:检索结果 summarization 前先 strip 指令样式文本;工具参数白名单;输出 filter。多租户 RAG 必须在向量查询 filter 中带 tenant_id+acl,不能检索后再过滤——否则泄露已发生。Skill/MCP 供应链要做签名与来源审查。红蓝对抗演练:定期用注入样...
大模型网关详解:多模型路由、Fallback、限流与成本控制
网关把模型调用从业务代码里剥离成基础设施。 职责统一 API、鉴权、路由(按任务/租户/语言)、fallback、限流、缓存、计费、日志。Router 偏策略;Gateway 偏策略+策略执行+策略存储。 路由策略简单问答小模型;复杂推理强模型;失败降级;A/B 与 canary。成本:强模型仅走 escalation 规则。 与 RAG/Agent网关不替代 RAG,位于模型调用边界。Agent 多次调用更依赖网关聚合计费与 timeout。 误区网关层过厚拖延迟;无 fallback 单点;所有请求最强模型成本爆炸。 延伸思考网关可内置 semantic cache(相似 query 命中),注意 privacy 分区。Fallback 链:主模型→备用模型→规则回复。Rate limit 支持 token bucket 与并发数双限。成本报表按 team/model/day 聚合,驱动 routing 策略。与 Service Mesh 关系:网关是 L7 AI 专用,Mesh 管通用 mTLS 与流量。自建 ...
AI 语音技术详解:从 ASR、TTS 到实时语音 Agent 的工程化落地
语音 Agent 是 ASR + 对话内核 + TTS 的低延迟闭环,工程难点在打断与流式。 链路麦克风 → VAD → 流式 ASR → 文本 Agent/LLM → 流式 TTS → 播放。全双工需 echo cancel 与 barge-in(用户打断)。 ASR/TTS 选型ASR:云端 API vs 本地;流式 vs 批式。TTS:神经 vocoder、情感、多说话人。延迟预算拆段监控。 与文本 Agent 差异口语更短、更噪;上下文需对话轮次压缩;工具调用仍经 FC/MCP。WebSocket 常见。 误区忽视网络 jitter;TTS 未流式导致首字延迟高;无打断体验差。 延伸思考实时语音需端到端延迟预算:ASR partial result、LLM 首 token、TTS 首包。VAD 减少无效识别。打断时取消进行中的 LLM/TTS 请求,避免「说话重叠」。噪声环境与口音影响 ASR,需 fallback 文本输入。合规场景录音需告知与留存策略。与文本 Agent 共用编排层,但应独立 scaling ASR/...
学习路线合集(2026 最新版):Java 后端、AI Agent、AI 应用开发、全栈与测开
围绕“学习路线合集(2026 最新版):Java 后端、AI Agent、AI 应用开发、全栈与测开”,本文不按原目录复述,而是把内容整理为问题、机制、实践和取舍四层。阅读时可从“后端方向、AI 方向、全栈方向、测试开发方向”几个切面建立自己的判断框架。 核心认识学习路线是能力之间的依赖图,不是必须逐项打卡的目录。应先从目标岗位和现有基础确定主线,再把每一阶段转换成可运行、可讲解、可复盘的成果。 总览的作用是建立知识地图和阅读顺序。先掌握核心问题与术语之间的关系,再按项目瓶颈深入专题;只记目录而缺少实验和复盘,无法形成工程能力。 学习这类主题时,应先写清对象、边界和衡量指标,再讨论具体组件或技巧。同一方案放在不同流量、数据规模与团队能力下,结论可能相反;设计说明必须保留前提。 工程实践学习过程需要输入、实践和反馈闭环:阅读建立地图,小项目验证理解,测试与观测暴露问题,复盘决定下一阶段。作品应覆盖设计、实现、交付和故障处理。 实施建议采用小步验证:记录变更前基线,一次只调整少量关键变量,通过日志、指标和测试判断收益。上线后继续观察长尾与异常路径,并把操作步骤沉淀成可执行预案。 ...
AI 应用系统设计:从 Prompt Demo 到生产级架构
生产架构要把「一次聊天」变成可治理、可扩展的任务流水线。 分层入口(鉴权、限流、会话)→ 编排(Agent/Workflow)→ 能力(RAG/Memory/Tools)→ 模型网关 → 观测与存储。Demo 常缺编排与治理层。 三类上下文RAG 知识(只读、带来源);Memory(用户态、可写);Tool 结果( ephemeral、需摘要)。勿混在一个 blob Prompt 里。 交互模式同步适合低延迟短答;流式改善体验;异步队列适合长 Agent 任务 + 回调/Webhook。 误区Prompt 硬编码在代码;无 idempotency;单模型无 fallback。 延伸思考入口层除鉴权外,还应做 prompt injection 初筛、请求大小限制、会话 fixation 防护。编排层持久化 run state,支持 cancel。Prompt 管理用 Git+配置中心,版本与发布绑定。RAG/Memory/Tools 三个 context builder 独立模块,最后 merge 时做 token b...
AI 系统设计专题:从生产级架构到安全、可观测与语音 Agent
系统设计专题回答「Prompt Demo 如何变成可运维的后端服务」。 范围应用分层架构;LLM 网关;安全与权限;Trace 与评测;语音 Agent 全链路。与 LLM basis、Agent、RAG 交叉。 阅读顺序application-architecture → llm-gateway → llm-security → ai-observability → ai-voice。 工程原则模型外置;状态与 Prompt 版本化;失败可降级;可观测先行;安全默认拒绝。 误区单体脚本部署;密钥进 Prompt;无 SLO 与成本预算。 延伸思考系统设计专题与开发专题的交界在网关与可观测:它们横切所有 AI 功能。语音 Agent 是独立高延迟链路,不宜与文本服务混部署而不隔离资源。学习输出标准:能画生产架构、能列安全清单、能估 Token 成本、能设计 Trace schema。与 Java/Go 后端结合时,AI 能力宜作为独立 service 或 sidecar,通过 internal API 调用,便于独立扩缩与密钥管理。 实践小结练习:对照专题给现有 A...
多 Agent 协作系统设计:任务拆分、状态共享、冲突处理与失败恢复
多 Agent 适合角色分工明确、子任务可并行的复杂流程,而非默认架构。 何时使用单 Agent + 好工具往往足够。多 Agent 适用于:规划/执行/审查角色分离、并行检索多数据源、专业域模型分工。多阶段 Prompt Chain 是线性流水线;多 Agent 强调状态共享与动态委派。 设计要点先定编排:Supervisor、Peer、Hierarchical。子任务契约化(输入/输出 Schema、超时、重试)。并行需幂等与冲突合并策略;共享黑板或消息总线传递状态。 失败恢复子 Agent 失败:降级、换路、人工介入。避免「电话游戏」式长链传递丢信息。Trace 按 agent_id 分 Span。 误区Agent 数量越多越好;无统一状态导致重复劳动;忽视 Token 成本翻倍。 延伸思考静态角色(Planner/Worker/Critic)适合流程稳定;动态委派适合任务类型事先未知。并行子任务要定义聚合器:何时合并结果、冲突字段听谁的、是否投票。共享状态推荐版本化 document,避免并发写覆盖。失败恢复可设「监督...
Harness 是什么?Harness Engineering 六层架构与 Agent 工程实践
模型负责想,Harness 负责跑——权限、沙箱、重试、校验都在 Harness。 核心公式Agent = Model + Harness。Harness 包含工具运行时、策略钩子、状态持久化、人机协同中断、评测探针等。瓶颈常在 Harness:模型升级 10%,Harness 成熟度决定能否上线。 六层架构(概念)接口层(CLI/IDE/API)→ 编排层(Loop/Graph)→ 上下文层(检索/Memory)→ 工具层(MCP/FC)→ 治理层(权限/审计/限流)→ 观测层(Trace/Metrics)。各层职责清晰,避免 Prompt 里堆叠业务逻辑。 实践要点Hooks 在工具前后做校验;沙箱执行代码;失败可恢复 checkpoint;长任务支持 interrupt/resume。上下文压缩策略放在 Harness,而非指望模型自觉总结。 误区只换更强模型不补 Harness;工具无权限分级;无 Trace 无法复盘 Badcase。 延伸思考成熟 Harness 通...
AI 工作流中的 Workflow、Graph 与 Loop:从概念到实现
AI 工作流要在「可控」与「灵活」之间取平衡——Graph 定骨架,Loop 允许回溯。 概念关系Workflow 是业务步骤序列;Graph 用节点与边表达分支与并行;Loop 是 Graph 上的回边,支持重试、反思、人工补料。传统 BPM 路径确定;AI Workflow 节点内可能是 LLM 或 Agent。 AI 工作流特点节点输入输出不确定;需 guardrail 与 fallback;Human-in-the-loop 常见。Graph 适合审批、ETL+生成混合;自由 Agent 适合探索型任务。 实现要点状态机持久化;边条件可结合模型分类器或规则;Loop 上限防死循环。LangGraph 等框架本质是 Graph + Checkpoint。 误区一切上 Graph 导致僵化;Loop 无退出条件;Graph 节点过大难以观测。 延伸思考选型时可问:步骤是否可预先枚举?失败是否需要回到上游重试?是否需要人工审批节点?若三者多为是,用 Graph+Loop;若任务高度开放,用 Agent Loop 包在少数 Graph 节点内。实现上,Checkpoint 保...