边缘AI:模型装在手机和IoT设备上
边缘AI优势 数据不出设备,隐私好 不需要网络,离线可用 延迟低 没有API费用 现状 7B模型量化后可在旗舰手机运行 端侧AI助手正在成为标配 苹果、华为、高通都在推 局限 模型能力不如云端大模型 复杂任务还是要调云端 占用手机存储
边缘AI优势 数据不出设备,隐私好 不需要网络,离线可用 延迟低 没有API费用 现状 7B模型量化后可在旗舰手机运行 端侧AI助手正在成为标配 苹果、华为、高通都在推 局限 模型能力不如云端大模型 复杂任务还是要调云端 占用手机存储
新搜索方式 拍一张图找同款 录一段语音找信息 截一张视频帧找来源 技术基础 CLIP类模型把图片和文字映射到同一空间,实现跨模态检索。 对SEO的影响 图片alt文本更重要了 视频内容被索引的比例在增加 结构化数据标记多模态内容
开源阵营 Llama、Qwen、DeepSeek、Mistral 优势:免费、可本地部署、可定制 劣势:多模态和Agent生态弱 闭源阵营 GPT、Claude、Gemini 优势:能力强、生态好、开箱即用 劣势:贵、数据在云端、不能定制 趋势 差距在缩小。开源在追上,闭源在做Agent和多模态。
没死但变了 不再需要背提示模板 模型越来越理解自然语言 自动优化工具能找到最佳提示 还需要什么 清晰表达需求的能力 理解模型局限的能力 设计多步推理链的能力 结论 提示工程从’技能’变成了’常识’。
别做大模型 基础模型是巨头的游戏。创业者应该做模型之上的事。 6个方向 1. 垂直行业Agent 医疗文书、法律合同、金融研报——行业知识+工作流=壁垒。 2. AI工作流自动化 帮企业把重复工作自动化,按效果收费。比卖SaaS更有说服力。 3. AI内容工厂 批量生产高质量内容,服务需要SEO和营销的企业。 4. 本地部署咨询 帮企业在本地部署开源模型,数据不出内网。 5. AI评测工具 帮企业评估和选型模型,市场需求巨大。 6. AI教育和培训 不是教Prompt,是教AI时代的工作方式。
为什么需要编排 单个Agent能做的事有限。复杂任务需要多个Agent分工协作——但协作不是简单地把几个Agent串起来,需要精心设计编排模式。 5种实用编排模式 1. 流水线(Pipeline) 最经典的模式:规划→执行→审查。每个Agent只做一件事,质量最稳定。 2. 主管-工人(Supervisor-Worker) 一个主管Agent拆解任务,分给多个工人Agent执行,主管负责汇总和纠错。适合复杂任务。 3. 辩论(Debate) 多个Agent从不同角度讨论同一个问题,最终达成共识。适合需要多角度分析的决策场景。 4. 层级(Hierarchical) 像公司组织架构一样,顶层战略Agent→中层战术Agent→底层执行Agent。适合大型项目。 5. 动态拓扑(Dynamic) Agent根据任务自动决定和谁协作。最灵活但最难调试,2026年还在早期。 选型建议 简单任务:流水线 中等复杂度:主管-工人 需要深度思考:辩论 不要上来就用动态拓扑,调试会疯
2026年的价格变化 主流模型价格比2024年下降了80-90%。GPT-4级别模型现在每百万token不到1美元。但这只是起点。 四层省钱策略 第一层:模型路由 不是所有问题都需要最强模型。用小模型做分类和简单问答,只把复杂问题路由给大模型。实测能省60-70%。 第二层:语义缓存 相同或相似的问题直接返回缓存结果。高频场景命中率可达40%。 第三层:Prompt压缩 系统提示词精简、few-shot示例自动选择、对话历史截断。Token用量减少30%。 第四层:自托管 高频场景直接部署开源模型,边际成本趋近于零。 实际案例 一个日均10万次调用的AI应用,通过四层优化,月成本从5000美元降到300美元。
为什么记忆是Agent的最后一块拼图 2025年的AI Agent缺的不是工具调用能力,而是长期记忆。一个不能记住用户偏好、不能从历史交互中学习的Agent,每次对话都是从零开始。 2026年,这个问题正在被解决。 三大技术路线 1. MCP Memory协议 Anthropic推出的MCP协议生态中,Memory Server成为最热门的节点。Agent可以通过标准接口读写长期记忆,不再需要每个应用自己造轮子。 2. 向量数据库+知识图谱 纯向量检索容易产生"语义漂移",2026年的主流方案是向量+图谱混合检索:向量负责语义相似,图谱负责逻辑关联。 3. 分层记忆架构 工作记忆:当前对话上下文 情景记忆:历史交互记录 语义记忆:提取的知识和偏好 程序记忆:学会的技能和工作流 实际效果 接入记忆系统后,Agent的用户留存率提升40%以上,因为它"认识你了"——记得你的项目、你的偏好、你上次聊到哪。 下一步 记忆系统标准化之后,下一个战场是记忆的隐私和所有权——谁拥有Agent的记忆数据?用户能不能导出、删除?
搜索的范式转移 传统搜索:输入关键词→返回10个蓝色链接→你自己点进去找答案 AI搜索:输入问题→直接给答案+引用来源→一步到位 这对内容创作者意味着什么 传统SEO的价值在下降(不需要点链接了) 但内容被AI引用成为新的SEO 结构化、有数据、有深度的文章更容易被AI搜索引用 你的博客文章可能直接成为AI搜索的答案来源 如何让内容被AI搜索引用 文章结构清晰,有明确的问题和答案 有具体数据、具体例子、具体代码 使用FAQ格式,直接回答用户问题 多写"如何"、“为什么”、“区别"类长尾问题
为什么本地部署突然香了 2026年本地大模型能跑生产环境,靠的是三件事: 量化技术成熟(4-bit/3-bit几乎不掉点) 推理框架优化(vLLM、SGLang的吞吐提升10倍) 开源模型追上来了(Qwen3、DeepSeek V4本地版) 硬件选型 场景 推荐配置 成本 个人开发 RTX 4090 24GB 1.5万 团队部署 2×A100 80GB 20万 CPU推理 至强+128GB内存 3万 部署流程 选模型:Qwen3-72B-Instruct 或 DeepSeek-V4-70B 量化:AWQ 4-bit,质量损失<2% 框架:vLLM,连续批处理 接入:OpenAI兼容API,直接对接现有应用 踩坑记录 KV Cache管理是吞吐关键,max_model_len不要设太大 多轮对话要自己管理history,框架不管 量化后有些推理能力会下降,代码模型建议保留更多精度