<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>长时任务 on AI 实战派 · 从技术到赚钱</title><link>https://guijiagi.com/tags/%E9%95%BF%E6%97%B6%E4%BB%BB%E5%8A%A1/</link><description>Recent content in 长时任务 on AI 实战派 · 从技术到赚钱</description><generator>Hugo</generator><language>zh-cn</language><copyright>本站内容采用 CC BY-NC-SA 4.0 国际许可协议授权</copyright><lastBuildDate>Mon, 14 Sep 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://guijiagi.com/tags/%E9%95%BF%E6%97%B6%E4%BB%BB%E5%8A%A1/index.xml" rel="self" type="application/rss+xml"/><item><title>Claude Fable 5.1评测：长时智能体的新标杆</title><link>https://guijiagi.com/posts/claude-fable-5-1-long-horizon-agent/</link><pubDate>Mon, 14 Sep 2026 10:00:00 +0800</pubDate><guid>https://guijiagi.com/posts/claude-fable-5-1-long-horizon-agent/</guid><description>&lt;h2 id="引子当模型学会连续工作38小时">引子：当模型学会&amp;quot;连续工作38小时&amp;quot;&lt;/h2>
&lt;p>如果说GPT-6 Astra定义了&amp;quot;最强单点智能&amp;quot;，那么Anthropic在2026年9月1日发布的Claude Fable 5.1，定义的是另一条赛道——&lt;strong>长时智能体（long-horizon agent）&lt;/strong>。&lt;/p>
&lt;p>过去两年，所有Agent Demo都有一个共同的软肋：演示很酷，一旦任务拉长到几十步，模型就开始跑偏、忘记目标、重复犯错。Anthropic这次要解决的，恰恰是这个&amp;quot;跑不长&amp;quot;的问题。Fable 5.1最扎眼的宣传点不是某一项基准刷了多少分，而是它可以&lt;strong>连续自主运行38小时&lt;/strong>而不需要人类干预。这在AI智能体领域，是一个质变级别的数字。&lt;/p>
&lt;h2 id="一张成绩单terminal-bench-40的558">一张成绩单：Terminal-Bench 4.0的55.8%&lt;/h2>
&lt;p>衡量长时智能体，不能只看聊天基准，要看它在真实终端环境里能不能把一件事从头做到尾。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>评测项&lt;/th>
&lt;th>含义&lt;/th>
&lt;th>Claude Fable 5.1&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>Terminal-Bench 4.0&lt;/td>
&lt;td>终端环境多步任务完成率&lt;/td>
&lt;td>55.8%&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>Intelligence Index&lt;/td>
&lt;td>综合智能指数&lt;/td>
&lt;td>66&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>连续自主运行时长&lt;/td>
&lt;td>无人工干预上限&lt;/td>
&lt;td>38小时&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>缓存读取成本&lt;/td>
&lt;td>对比上一代&lt;/td>
&lt;td>下降75%&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>Terminal-Bench 4.0的55.8%需要放在历史坐标里看。一年前，即便是最顶尖的智能体模型，在这一类多步终端任务上的完成率也长期卡在20%–30%区间。55.8%意味着过半的复杂任务可以由模型独立闭环——这个比例在工程上已经跨过了&amp;quot;可用&amp;quot;的门槛。&lt;/p>
&lt;p>Intelligence Index拿到66，则是Anthropic自家综合评测体系的新高位。它把推理、代码、多模态、长时规划揉在一起打分，66分的位置标志着Fable 5.1在通用智能上紧跟第一梯队，而不是只在Agent这一单项上偏科。&lt;/p>
&lt;blockquote>
&lt;p>数据来源：Anthropic发布公告与技术报告，2026年9月1日&lt;/p>&lt;/blockquote>
&lt;h2 id="关键的工程突破75的缓存成本下降">关键的工程突破：75%的缓存成本下降&lt;/h2>
&lt;p>很多人把目光放在&amp;quot;38小时&amp;quot;上，但真正决定Fable 5.1能否规模化商用的，是那个容易被忽略的数字——&lt;strong>缓存读取成本下降75%&lt;/strong>。&lt;/p>
&lt;p>长时智能体为什么烧钱？因为它要在几十小时里不断回顾自己之前的操作记录、代码上下文、历史决策。这些历史Token会被反复读取，构成推理成本里的大头。Anthropic通过改进Prompt缓存机制，把这部分读取开销砍掉了四分之三。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>成本构成&lt;/th>
&lt;th>上一代&lt;/th>
&lt;th>Fable 5.1&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>常规输入&lt;/td>
&lt;td>基准&lt;/td>
&lt;td>基准&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>缓存读取&lt;/td>
&lt;td>100%&lt;/td>
&lt;td>25%&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>长任务累计开销&lt;/td>
&lt;td>高&lt;/td>
&lt;td>显著降低&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>这个优化的商业意义极大：它让&amp;quot;让Agent自己跑一天&amp;quot;从一个昂贵的Demo，变成一个企业可以批量采购的服务。当缓存读取成本降到原来的四分之一，长时任务的单位经济性第一次成立了。&lt;/p>
&lt;h2 id="它到底能做什么38小时不是噱头">它到底能做什么：38小时不是噱头&lt;/h2>
&lt;p>要理解38小时的含金量，得想清楚一个长时智能体在这段时间里要面对什么：&lt;/p>
&lt;ul>
&lt;li>&lt;strong>状态不漂移&lt;/strong>：几十步之后还记得最初的目标是什么，不被中间的报错带偏&lt;/li>
&lt;li>&lt;strong>错误自恢复&lt;/strong>：跑挂了能自己看日志、定位原因、重试，而不是停下来喊人&lt;/li>
&lt;li>&lt;strong>资源管理&lt;/strong>：在有限的上下文里决定记住什么、忘掉什么&lt;/li>
&lt;li>&lt;strong>外部工具调用&lt;/strong>：跨文件系统、代码仓库、网络请求连续作业&lt;/li>
&lt;/ul>
&lt;p>这四件事，任何一件做不好，任务就会在中途崩掉。Fable 5.1能把这四件事串起来跑满38小时，靠的不是单次推理更强，而是&lt;strong>规划与自我纠错能力&lt;/strong>的系统性提升。这是一种和&amp;quot;刷分&amp;quot;完全不同的能力维度——它衡量的是模型在真实、嘈杂、不完美环境里的韧性。&lt;/p>
&lt;h2 id="与gpt-6-astra的错位竞争">与GPT-6 Astra的错位竞争&lt;/h2>
&lt;p>把Fable 5.1和GPT-6 Astra放在一起，会发现它们其实在打不同的仗。&lt;/p>
&lt;table>
&lt;thead>
&lt;tr>
&lt;th>维度&lt;/th>
&lt;th>GPT-6 Astra&lt;/th>
&lt;th>Claude Fable 5.1&lt;/th>
&lt;/tr>
&lt;/thead>
&lt;tbody>
&lt;tr>
&lt;td>强项&lt;/td>
&lt;td>单点极限推理、操作专业软件&lt;/td>
&lt;td>长时连续作业、终端任务闭环&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>标志成绩&lt;/td>
&lt;td>ARC-AGI-3 99.9%&lt;/td>
&lt;td>Terminal-Bench 4.0 55.8%&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>商用切入点&lt;/td>
&lt;td>企业级高价值岗位&lt;/td>
&lt;td>可批量采购的自动化流程&lt;/td>
&lt;/tr>
&lt;tr>
&lt;td>成本策略&lt;/td>
&lt;td>旗舰溢价&lt;/td>
&lt;td>缓存成本大幅下调&lt;/td>
&lt;/tr>
&lt;/tbody>
&lt;/table>
&lt;p>Astra像一个智商极高但按次收费的专家，Fable 5.1像一个可以长时间顶岗的熟练工。对企业用户来说，这不是二选一，而是组合使用：需要极限推理的硬骨头交给Astra，需要连续盯一天的运维、测试、数据流水线交给Fable 5.1。&lt;/p></description></item></channel></rss>