AI Agent可观测性:出错了怎么查?
Agent为什么难调试 不确定性:同一个输入可能走不同路径 多步推理:中间步骤不透明 工具调用:外部依赖多 需要监控什么 每步思考过程 工具调用输入输出 Token消耗和延迟 错误率和成功率 人工干预次数
Agent为什么难调试 不确定性:同一个输入可能走不同路径 多步推理:中间步骤不透明 工具调用:外部依赖多 需要监控什么 每步思考过程 工具调用输入输出 Token消耗和延迟 错误率和成功率 人工干预次数
从补全到独立开发 2024年Copilot补全单行代码,2025年能写整个函数,2026年的AI Agent已经能: 理解需求文档 自己拆任务 写代码+测试+调试 提交PR 三个层次 补全型:Copilot类,写一半猜另一半 协作型:Cursor类,理解上下文,主动建议 自主型:Devin类,给需求自己干活 对程序员的影响 初级编码工作在减少,但系统设计和代码审查的需求在增加。会用AI的程序员效率提升10倍,不会用的被淘汰。
死亡原因 1. 套壳没有壁垒 用户直接用ChatGPT为什么要用你的? 2. 获客成本太高 AI应用同质化严重,广告烧钱 3. 模型能力追平 大模型升级后,你的差异化功能被原生覆盖 活下来的共性 有独占数据 深入工作流,不是聊天框 有行业know-how 按效果收费,不是订阅
AI审查擅长 语法错误 安全漏洞 性能问题 代码风格 测试覆盖率 AI不擅长 业务逻辑对不对 架构是否合理 是否过度设计 命名是否符合团队习惯 最佳实践 AI先过一遍,人类再做业务和架构审查。
现状 5秒短片质量已经不错 人物一致性还是难题 动作逻辑偶尔穿帮 生成时间还很长 商用场景 广告素材批量生成 短视频内容 概念验证动画 电商产品展示 不适合的 连续剧(一致性不够) 需要精确口型 专业影视制作
现在能做什么 自动分类邮件(重要/推广/垃圾) 草拟回复,你确认后发送 会议邀请自动接受/拒绝 待办事项自动提取 关键信息摘要 下一步 自动回复常规邮件 邮件间关联和追踪 跨邮件协调日程 风险 误回复敏感邮件 信息泄露 需要人类审核机制
什么是MCP MCP让AI模型通过统一接口连接外部工具和数据源,类似USB-C之于硬件。 为什么重要 不用为每个模型写不同的集成 工具开发者写一次,所有模型都能用 Agent生态开始标准化 已有节点 文件系统、数据库、浏览器、GitHub、Google Drive、Slack……越来越多。
核心对比 维度 GPT-5 DeepSeek V4 推理能力 顶级 接近 代码能力 顶级 接近 中文理解 好 更好 API价格 高 低80% 本地部署 不支持 支持 结论 追求极致效果:GPT 中文场景+成本敏感:DeepSeek 数据不能出内网:本地DeepSeek 差距在缩小,但OpenAI在多模态和Agent生态上仍有优势。
三代RAG 1.0 朴素RAG 向量检索+拼接上下文,简单粗暴。 2.0 混合RAG 向量+关键词+重排序,准确率大幅提升。 3.0 Agentic RAG Agent自己决定:要不要查、查什么、查到之后怎么整合。甚至会交叉验证多个来源。 2026年的实践 查询改写:自动把用户问题改写成更好的搜索词 多跳推理:先查A,根据结果再查B 自我评估:检索结果不好会自动换关键词重查 工具组合:不只是查文档,还会调用API和数据库
选云端API 快速验证想法 不需要GPU 频繁切换模型 流量不稳定 选本地部署 数据敏感 高频调用(月均百万token以上) 需要定制微调 合规要求 混合架构 敏感数据走本地,通用问答走云端。成本最优。