avatar
文章
377
标签
447
分类
12
首页
留言板
知识库
归档
标签
分类
关于
Dai Wei
搜索
首页
留言板
知识库
归档
标签
分类
关于

Dai Wei

AI 可观测性与 Trace:如何还原 Agent 的完整执行过程
发表于2026-02-13|人工智能
AI 应用成功返回不等于正确——需要 Trace 还原推理与工具链。 信号分层Metrics:QPS、延迟、Token、错误率。Logs:结构化事件。Trace:跨服务调用树。Evaluation:离线/在线质量。Audit:合规与 tool 调用。 ID 层级Session(用户会话)→ Run(一次任务)→ Trace → Span(LLM/检索/tool)→ Attempt(重试)。Agent 请求拆多 Span 才可定位偏题步。 实践OpenTelemetry 传播 context;头部采样 + 错误尾部必留;关联 prompt_version、model、retrieval_ids。Dashboard 看 TTFT 与 tool 失败率。 误区只 log 最终答案;无 retrieval id 无法查「召回了什么」;采样率 100% 存不下。 延伸思考Agent Span 命名规范示例:llm.chat、retrieval.search、tool.execute、memory.read。Attributes 存 model、prompt...
LLM/Agent 安全实战:从 Prompt Injection、工具越权到沙箱隔离
发表于2026-02-06|人工智能
Agent 能执行工具时,安全面从「说错话」扩展到「做错事」。 威胁模型Prompt Injection(直接/间接);Jailbreak;工具越权;检索泄露未授权文档;供应链(恶意 Skill/MCP)。 防护信任分区:系统指令 vs 用户 vs 外部检索。检索前 ACL;外部 HTML 先提取再入上下文;工具最小权限;写操作确认;沙箱跑代码。 System Prompt 局限「忽略恶意指令」不可靠——需输入过滤、输出策略、工具 allowlist。记录 audit 便于追责。 误区认为 RAG 私有就安全;MCP 连上即信任;无 human-in-the-loop 高危操作。 延伸思考间接注入常来自检索到的网页、邮件、PDF——攻击指令藏在正文里。缓解:检索结果 summarization 前先 strip 指令样式文本;工具参数白名单;输出 filter。多租户 RAG 必须在向量查询 filter 中带 tenant_id+acl,不能检索后再过滤——否则泄露已发生。Skill/MCP 供应链要做签名与来源审查。红蓝对抗演练:定期用注入样...
大模型网关详解:多模型路由、Fallback、限流与成本控制
发表于2026-01-30|人工智能
网关把模型调用从业务代码里剥离成基础设施。 职责统一 API、鉴权、路由(按任务/租户/语言)、fallback、限流、缓存、计费、日志。Router 偏策略;Gateway 偏策略+策略执行+策略存储。 路由策略简单问答小模型;复杂推理强模型;失败降级;A/B 与 canary。成本:强模型仅走 escalation 规则。 与 RAG/Agent网关不替代 RAG,位于模型调用边界。Agent 多次调用更依赖网关聚合计费与 timeout。 误区网关层过厚拖延迟;无 fallback 单点;所有请求最强模型成本爆炸。 延伸思考网关可内置 semantic cache(相似 query 命中),注意 privacy 分区。Fallback 链:主模型→备用模型→规则回复。Rate limit 支持 token bucket 与并发数双限。成本报表按 team/model/day 聚合,驱动 routing 策略。与 Service Mesh 关系:网关是 L7 AI 专用,Mesh 管通用 mTLS 与流量。自建 ...
AI 语音技术详解:从 ASR、TTS 到实时语音 Agent 的工程化落地
发表于2026-01-22|人工智能
语音 Agent 是 ASR + 对话内核 + TTS 的低延迟闭环,工程难点在打断与流式。 链路麦克风 → VAD → 流式 ASR → 文本 Agent/LLM → 流式 TTS → 播放。全双工需 echo cancel 与 barge-in(用户打断)。 ASR/TTS 选型ASR:云端 API vs 本地;流式 vs 批式。TTS:神经 vocoder、情感、多说话人。延迟预算拆段监控。 与文本 Agent 差异口语更短、更噪;上下文需对话轮次压缩;工具调用仍经 FC/MCP。WebSocket 常见。 误区忽视网络 jitter;TTS 未流式导致首字延迟高;无打断体验差。 延伸思考实时语音需端到端延迟预算:ASR partial result、LLM 首 token、TTS 首包。VAD 减少无效识别。打断时取消进行中的 LLM/TTS 请求,避免「说话重叠」。噪声环境与口音影响 ASR,需 fallback 文本输入。合规场景录音需告知与留存策略。与文本 Agent 共用编排层,但应独立 scaling ASR/...
学习路线合集(2026 最新版):Java 后端、AI Agent、AI 应用开发、全栈与测开
发表于2026-01-15|学习路线
围绕“学习路线合集(2026 最新版):Java 后端、AI Agent、AI 应用开发、全栈与测开”,本文不按原目录复述,而是把内容整理为问题、机制、实践和取舍四层。阅读时可从“后端方向、AI 方向、全栈方向、测试开发方向”几个切面建立自己的判断框架。 核心认识学习路线是能力之间的依赖图,不是必须逐项打卡的目录。应先从目标岗位和现有基础确定主线,再把每一阶段转换成可运行、可讲解、可复盘的成果。 总览的作用是建立知识地图和阅读顺序。先掌握核心问题与术语之间的关系,再按项目瓶颈深入专题;只记目录而缺少实验和复盘,无法形成工程能力。 学习这类主题时,应先写清对象、边界和衡量指标,再讨论具体组件或技巧。同一方案放在不同流量、数据规模与团队能力下,结论可能相反;设计说明必须保留前提。 工程实践学习过程需要输入、实践和反馈闭环:阅读建立地图,小项目验证理解,测试与观测暴露问题,复盘决定下一阶段。作品应覆盖设计、实现、交付和故障处理。 实施建议采用小步验证:记录变更前基线,一次只调整少量关键变量,通过日志、指标和测试判断收益。上线后继续观察长尾与异常路径,并把操作步骤沉淀成可执行预案。 ...
AI 应用系统设计:从 Prompt Demo 到生产级架构
发表于2026-01-14|人工智能
生产架构要把「一次聊天」变成可治理、可扩展的任务流水线。 分层入口(鉴权、限流、会话)→ 编排(Agent/Workflow)→ 能力(RAG/Memory/Tools)→ 模型网关 → 观测与存储。Demo 常缺编排与治理层。 三类上下文RAG 知识(只读、带来源);Memory(用户态、可写);Tool 结果( ephemeral、需摘要)。勿混在一个 blob Prompt 里。 交互模式同步适合低延迟短答;流式改善体验;异步队列适合长 Agent 任务 + 回调/Webhook。 误区Prompt 硬编码在代码;无 idempotency;单模型无 fallback。 延伸思考入口层除鉴权外,还应做 prompt injection 初筛、请求大小限制、会话 fixation 防护。编排层持久化 run state,支持 cancel。Prompt 管理用 Git+配置中心,版本与发布绑定。RAG/Memory/Tools 三个 context builder 独立模块,最后 merge 时做 token b...
AI 系统设计专题:从生产级架构到安全、可观测与语音 Agent
发表于2026-01-07|人工智能
系统设计专题回答「Prompt Demo 如何变成可运维的后端服务」。 范围应用分层架构;LLM 网关;安全与权限;Trace 与评测;语音 Agent 全链路。与 LLM basis、Agent、RAG 交叉。 阅读顺序application-architecture → llm-gateway → llm-security → ai-observability → ai-voice。 工程原则模型外置;状态与 Prompt 版本化;失败可降级;可观测先行;安全默认拒绝。 误区单体脚本部署;密钥进 Prompt;无 SLO 与成本预算。 延伸思考系统设计专题与开发专题的交界在网关与可观测:它们横切所有 AI 功能。语音 Agent 是独立高延迟链路,不宜与文本服务混部署而不隔离资源。学习输出标准:能画生产架构、能列安全清单、能估 Token 成本、能设计 Trace schema。与 Java/Go 后端结合时,AI 能力宜作为独立 service 或 sidecar,通过 internal API 调用,便于独立扩缩与密钥管理。 实践小结练习:对照专题给现有 A...
多 Agent 协作系统设计:任务拆分、状态共享、冲突处理与失败恢复
发表于2025-12-30|人工智能
多 Agent 适合角色分工明确、子任务可并行的复杂流程,而非默认架构。 何时使用单 Agent + 好工具往往足够。多 Agent 适用于:规划/执行/审查角色分离、并行检索多数据源、专业域模型分工。多阶段 Prompt Chain 是线性流水线;多 Agent 强调状态共享与动态委派。 设计要点先定编排:Supervisor、Peer、Hierarchical。子任务契约化(输入/输出 Schema、超时、重试)。并行需幂等与冲突合并策略;共享黑板或消息总线传递状态。 失败恢复子 Agent 失败:降级、换路、人工介入。避免「电话游戏」式长链传递丢信息。Trace 按 agent_id 分 Span。 误区Agent 数量越多越好;无统一状态导致重复劳动;忽视 Token 成本翻倍。 延伸思考静态角色(Planner/Worker/Critic)适合流程稳定;动态委派适合任务类型事先未知。并行子任务要定义聚合器:何时合并结果、冲突字段听谁的、是否投票。共享状态推荐版本化 document,避免并发写覆盖。失败恢复可设「监督...
Harness 是什么?Harness Engineering 六层架构与 Agent 工程实践
发表于2025-12-22|人工智能
模型负责想,Harness 负责跑——权限、沙箱、重试、校验都在 Harness。 核心公式Agent = Model + Harness。Harness 包含工具运行时、策略钩子、状态持久化、人机协同中断、评测探针等。瓶颈常在 Harness:模型升级 10%,Harness 成熟度决定能否上线。 六层架构(概念)接口层(CLI/IDE/API)→ 编排层(Loop/Graph)→ 上下文层(检索/Memory)→ 工具层(MCP/FC)→ 治理层(权限/审计/限流)→ 观测层(Trace/Metrics)。各层职责清晰,避免 Prompt 里堆叠业务逻辑。 实践要点Hooks 在工具前后做校验;沙箱执行代码;失败可恢复 checkpoint;长任务支持 interrupt/resume。上下文压缩策略放在 Harness,而非指望模型自觉总结。 误区只换更强模型不补 Harness;工具无权限分级;无 Trace 无法复盘 Badcase。 延伸思考成熟 Harness 通...
AI 工作流中的 Workflow、Graph 与 Loop:从概念到实现
发表于2025-12-13|人工智能
AI 工作流要在「可控」与「灵活」之间取平衡——Graph 定骨架,Loop 允许回溯。 概念关系Workflow 是业务步骤序列;Graph 用节点与边表达分支与并行;Loop 是 Graph 上的回边,支持重试、反思、人工补料。传统 BPM 路径确定;AI Workflow 节点内可能是 LLM 或 Agent。 AI 工作流特点节点输入输出不确定;需 guardrail 与 fallback;Human-in-the-loop 常见。Graph 适合审批、ETL+生成混合;自由 Agent 适合探索型任务。 实现要点状态机持久化;边条件可结合模型分类器或规则;Loop 上限防死循环。LangGraph 等框架本质是 Graph + Checkpoint。 误区一切上 Graph 导致僵化;Loop 无退出条件;Graph 节点过大难以观测。 延伸思考选型时可问:步骤是否可预先枚举?失败是否需要回到上游重试?是否需要人工审批节点?若三者多为是,用 Graph+Loop;若任务高度开放,用 Agent Loop 包在少数 Graph 节点内。实现上,Checkpoint 保...
1…456…38
avatar
Dai Wei
软件开发者,记录技术探索与实践
文章
377
标签
447
分类
12
Follow Me
公告
分享软件开发、工程实践与持续学习中的思考。
最新文章
Trae + MiniMax 多场景实战:Redis 故障排查与跨语言重构2026-08-28
Kimi K3 实战:全栈项目、Java 项目改造与 3A 游戏 Demo2026-08-23
测试开发学习路线(2026 最新版):AI 时代如何从测试走向质量工程2026-08-20
IDEA + Qoder 插件多场景实战:接口优化与代码重构2026-08-18
DeepSeek V4 + Claude Code 实战:代码能力深度测评2026-08-14
分类
  • AI 编程28
  • Java103
  • 人工智能39
  • 分布式系统26
  • 学习路线5
  • 开发工具11
  • 数据库42
  • 系统设计26
标签
线程优先级 DBMS 大模型 Java基础 命令 Top K 安全 Loop 计算机网络 Raft 贪心 修饰权限 TCC 最终一致性 召回 网络编程三要素 服务调用 分布式理论 知识体系 复杂度 红黑树 Unsafe 面试 Java26 BASE 内存管理 语音 redo log Kimi NoSQL Seata CAS 优化器 RDB 线程通信 面试题 IDE 死锁 ZAB 编排
归档
  • 八月 2026 7
  • 七月 2026 7
  • 六月 2026 6
  • 五月 2026 7
  • 四月 2026 6
  • 三月 2026 4
  • 二月 2026 5
  • 一月 2026 5
网站信息
文章数目 :
377
本站访客数 :
本站总浏览量 :
最后更新时间 :
© 2017 - 2026 By Dai Wei框架 Hexo 8.1.2|主题 Butterfly 5.7.0
搜索
数据加载中