Agent Skills 是什么?和 Prompt、MCP 到底差在哪?
Skill 是可按需加载的能力包,把 SOP、约束与工具说明从主上下文剥离。 概念边界Prompt 是一次性指令;MCP 是工具协议;FC 是调用格式;Skill 是「何时用、怎么用、检查什么」的打包文档 + 可选脚本。模型通过 description 匹配 Skill,再加载完整 SKILL.md。 结构实践SKILL.md 含:适用场景、步骤、禁止项、输出格式、示例。配合 Rule/Flow/Use For 元数据。TDD 式 Skill:先写期望行为再补步骤。 工程价值减少每轮重复塞长 Prompt;团队共享最佳实践;版本化与 prune 避免 Skill 爆炸。 误区Skill 越多越好导致选择困难;Skill 与 MCP Tool 职责重叠未清理;无评测验证 Skill 真被正确触发。 延伸思考SKILL.md 写作应回答:何时触发、输入输出、步骤顺序、失败怎么办、示例对话。Rule 适合硬约束,Flow 适合分支流程,Use For 帮助 router 匹配。Skill 与 MCP Tool 分工:Tool 是能力接口,Skill 是使用手册。...
大模型提示词工程(Prompt Engineering)是什么?提示词技巧有哪些?
Prompt 是把模糊意图翻译成模型可稳定执行的指令契约。 四要素角色(谁在说)、任务(做什么)、上下文(依据什么)、格式(怎么输出)。缺格式易漂移;缺角色易风格混乱。别把 Prompt 写成万字说明书——优先清晰约束与反例。 常用技巧Few-shot 给 1–3 个示范;CoT 要求分步推理;Self-consistency 多采样投票;结构化输出配合 JSON Schema。角色扮演适合风格,不适合替代 factual 检索。 迭代方法建立小评测集;每次只改一处;记录 version 与指标。生产 Prompt 放配置中心或模板库,与代码分离。 误区Prompt 万能论;忽视温度与 top_p;不做失败样例回归。 延伸思考四要素之外,还应考虑「负向约束」:不要做什么、遇到不确定如何拒答。CoT 在数学与逻辑题有效,但在强工具场景可能诱导冗长推理,可改用「先列检查清单再行动」。Prompt 版本要与模型版本绑定回归——换模型后旧 Prompt 可能失效。企业环境建议 Prompt 模板化,变量仅填业务字段,核心安全策略放在 System 层且尽量短,降低被用户覆盖的概率。 ...
什么是 Model Context Protocol (MCP)?和 Function Calling、Agent 什么关系?
MCP 统一工具与资源的接入协议,降低 N×M 集成成本。 定位Function Calling 是模型侧「输出调用意图」的能力;MCP 是 Host 与 Server 之间的标准协议,暴露 Tools、Resources、Prompts 等。Agent 通过 MCP Client 发现能力并调用,Server 可独立部署与版本化。 调用流程Host 启动 → 连接 Server → list_tools / list_resources → 模型选中 tool → JSON-RPC 请求 → Server 执行 → 结果返回 Host → 写入上下文。Roots 限定文件范围;Sampling 允许 Server 反向请求模型。 工程实践一能力一 Server 便于权限隔离;敏感工具默认关闭;记录 call_id 审计。与 FC 配合:模型仍走 FC 格式,Host 映射到 MCP 调用。 安全误区MCP 不自带鉴权——必须自己做 OAuth、scope、网络隔离。勿把「能连上 MCP」等于「生产可用」。 延伸思考生产部署 MCP Server 时,建议独立进程 ...
Loop Engineering 是什么?为什么说它是新瓶装旧酒?
Loop 不是新概念,而是把 ReAct、工作流回边、Harness 统一到可维护结构。 两层循环内层 Agent Loop:单轮推理-行动-观察。外层 Loop Engineering:任务级 retry、反思、人工审批、子目标重规划。Workflow/Graph 提供可控回边;纯自由 Agent 易死循环。 与相关概念ReAct 是内层模式;Context Engineering 决定每圈输入;Skills 沉淀重复流程;MCP 接工具;Harness 包住执行环境。所谓「新瓶装旧酒」指编排思想来自状态机与 DAG,只是 LLM 充当转移函数。 落地建议明确停止条件(max steps、工具无进展、置信度);死循环检测;关键节点允许 Graph 强制跳转。Skills 减少每轮重复解释 SOP。 误区无限 Loop 烧 Token;无外层 Loop 导致单 Agent 承担产品级流程;把 Loop 与多 Agent 混为一谈。 延伸思考外层 Loop 可承载:失败后换策略、调用 critic 模型审查、触发人工补资料、或降级为纯 RAG 问答。内层 Loop 则...
上下文工程(Context Engineering) 是什么?和 Prompt Engineering 有什么区别?
同样模型与 Prompt,差在「每轮看见什么」——这就是 Context Engineering。 与 Prompt Engineering 的差别Prompt 定角色、格式与约束;Context 定证据、工具结果、记忆与检索片段的组装顺序与预算。Prompt 写一次;Context 每轮动态变化。只优化 Prompt 不管理上下文,Agent 跑三轮就可能丢目标。 失效机制窗口溢出截断关键指令;检索噪声淹没要点;工具返回过长未摘要;多源内容顺序不当导致模型跟错重点。中间位置信息利用弱是已知现象,重要约束应靠近首尾。 工程实践分层:系统指令 / 任务状态 / 检索证据 / 工具输出 / 用户输入。设 Token 预算与优先级;预检索 + 运行时按需加载;对工具结果做结构化摘要。评估用固定任务集对比「换上下文策略」的 success rate。 误区上下文越多越好;把所有 MCP Resource 一次性塞入;不做来源标注导致模型混淆用户输入与外部网页。 延伸思考预检索往往不够,因为用户追问会改变信息需求。运行时 Context 应支持按...
AI Agent 记忆系统:短期记忆、长期记忆与记忆演化机制
记忆让 Agent 跨轮次保持任务连贯,也是长对话失控的主要变量。 记忆分类短期记忆通常是对话历史与当前任务状态,受上下文窗口限制。长期记忆存用户偏好、历史结论、实体关系,常用向量库或 KV/图数据库。 episodic 记「发生了什么」,semantic 记「知道什么」。 生命周期写入:工具结果、用户确认、摘要压缩后入库。读取:按 query 检索相关记忆注入上下文。更新:冲突合并、过期淘汰、重要性打分。遗忘:主动删除敏感或过时条目。 与 RAG 的边界RAG 面向企业知识库、强调溯源与权限;Memory 面向会话/用户态、强调个性化与任务连续。二者可共存:RAG 供事实,Memory 供交互历史。勿把整库当 Memory 无差别注入。 实践与误区长任务定期做 rolling summary;记忆写入前脱敏。误区:无限追加历史导致偏题;不做去重重复注入矛盾信息;长期记忆无 TTL 引发隐私风险。 延伸思考工程上可为 Memory 设计写入门槛:仅持久化用户显式确认、工具返回的结构化结论、或经摘要压缩后的高价值事实。读取侧做相关性阈值,低于阈值不注入,避免...
AI Agent 核心概念:Agent Loop、Plan-and-Execute、A2A、Agentic Workflows、Tools 注册
理解 Agent 首先要分清:谁决定下一步——程序员、流程图,还是模型。 概念辨析传统编程路径固定;Workflow 用 DAG 约束分支;Agent 由模型根据 Observation 动态选动作。订单扣库存适合代码;「排查服务变慢」适合 Agent——中间证据决定下一步查监控还是日志。 Agent Loop 机制每轮:LLM 读上下文 → 输出工具调用或最终答案 → 执行工具 → 结果写回上下文。ReAct 显式交替推理与行动。Plan-and-Execute 先规划再逐步执行,适合步骤多但子任务可拆的场景。 工程落地最少三层:工具层(Schema + 鉴权)、编排层(Loop/停止条件)、观测层(日志/Trace)。Tools 注册遵循 name/description/parameters JSON Schema;执行结果必须回灌上下文。 风险与误区长上下文不等于更好——中间信息利用率低、成本飙升。工具不能消灭幻觉,只能约束行动边界。多 Agent 之前先做单 Agent 闭环与评测。 延伸思考实现 Agent Loop 时,建...
AI Agent 专题:Agent Loop、Memory、Prompt、Context、MCP 与 Skills
Agent 专题解决「模型如何持续感知环境并执行动作」这一核心问题。 核心概念Agent = 推理模型 + 规划 + 记忆 + 工具。与聊天机器人的差别在于闭环:每轮读取 Observation,再决定 Action,直到满足停止条件。Workflow 预定义路径;Agent 在部分步骤动态决策。 工作机制Agent Loop:Thought → Action → Observation 循环。Memory 分短期(上下文窗口)与长期(向量库/结构化存储)。Context Engineering 管理每轮输入什么;Harness 提供可执行、可观测的运行壳。 工程实践入门路径:Agent 基础 → Prompt/Context → MCP/Skills → 多 Agent → Workflow/Graph/Loop。工具注册用 JSON Schema;高危操作人工确认;长任务做 checkpoint 与上下文压缩。 评估与安全用 Trace 还原每步工具调用;评测覆盖「工具选对了吗、参数对吗、是否越权」。误区:以为 ...
RAG 优化:从召回、重排到上下文工程
RAG 优化先修数据,再调检索,最后才换大模型。 优化闭环标注 Badcase → 定位层(解析/Chunk/召回/重排/生成)→ 改策略 → Golden 回归。指标:Recall@K、MRR、答案 grounded 率、人工分。 召回层混合检索 BM25 + 向量;Query 改写/HyDE;多路召回合并。重排用 cross-encoder 或小模型。 上下文去重、排序、长度预算;引用格式约束;拒答当检索分低时。 误区一上来换 GPT-4;忽视 Metadata 过滤;无标注集盲目调参。 延伸思考Badcase 分类示例:未召回(调 chunk/混合检索)、召回了但排序靠后(调 rerank)、上下文太长模型忽略(压缩/重排)、生成了未在片段中的事实(加强引用约束与拒答)。数据治理包括:去重、敏感信息脱敏、过期文档下架。A/B 可对比 reranker 有无、top_k 大小、query rewrite 策略。优化顺序切忌跳步——没有标注集就无法证明改动有效。 实践小结练习:标注 20 条 B...
GraphRAG:用图结构补充向量检索
向量 Top-K 擅长相似片段,GraphRAG 补关系推理与全局摘要类问题。 动机Chunk 孤岛化;向量相似度不保证逻辑邻接;「整个库的趋势」类问题需社区检测与图遍历。GraphRAG 构建实体关系图,检索时走子图 + 摘要。 机制索引期:抽取实体边、社区划分、生成社区摘要。查询期:局部向量检索 + 图扩展 + 汇总 Prompt。成本高于纯向量 RAG。 选型适合关系密集、多跳问答、研报类全局问题。简单 FAQ 纯向量即可。可混合:向量初召 + 图 refine。 误区一切上图;忽视构建与更新成本;图质量差于向量 baseline 未对比评测。 延伸思考GraphRAG 索引成本包含实体抽取 LLM 调用、社区摘要生成与图存储。查询时若走全局搜索,延迟高于普通 RAG,适合离线分析型问答而非毫秒级客服。与向量混合:先用向量找种子实体,再 k-hop 扩展。更新时图边也需增量维护,否则节点过期。评测应用多跳数据集验证是否真的优于 baseline,避免为图而图。 实践小结练习:选 5 个多跳问题,对比向量 RAG 与(若有)图扩展结果。估算构图 LLM 成本是否可接受。明...