AI就业创造论:16.2万新岗位背后的产业变革

8月的就业数据:AI不仅没抢饭碗,还在创造 “AI会抢掉多少人的工作?“这个问题从ChatGPT火的那天起就吵个不停。2026年8月,美国劳工部给出了一个反直觉的答案:当月新增就业岗位约16.2万个,远超市场预期。 在AI已经深度渗透办公、编程、客服、设计的2026年,就业市场不但没有崩,反而比预期更有韧性。这给"AI毁灭就业论"泼了一盆冷水。 数据来源:美国非农就业数据,2026年8月;Anthropic Economic Index Anthropic Economic Index:200万次交互告诉我们什么 数字之外,更有说服力的是微观证据。Anthropic发布的Economic Index分析了约200万次真实人机交互,试图回答一个核心问题:AI到底是在替代人,还是在增强人? 结论倾向于后者: 大多数场景下,AI不是把一个岗位整个抹掉,而是把一个岗位里最重复、最耗时间的那部分吃掉; 被释放出来的时间和注意力,被用来做更高价值的事——更复杂的判断、更有创意的方案、更长尾的客户服务; 企业没有因此大规模裁员,反而因为效率提升,开始承接更多业务、雇佣更多人。 这与历史上电力、个人电脑、互联网的就业轨迹高度相似:技术先消灭一部分任务,再创造出一整批当时谁也没预料到的新岗位。 岗位结构正在重新洗牌,而不是消失 “AI创造就业"不等于"你的原岗原位不动”。真实发生的是结构迁移: 被压缩的: 初级重复性文案、基础数据录入、标准化客服问答; 模板化代码编写、简单报表生成; 低风险的初审、初筛、初稿。 在膨胀的: AI训练师、提示工程师、智能体编排师; AI输出的"审阅者”——因为AI会一本正经地胡说,需要人来把关; 模型与业务流程的"翻译官”,把公司需求翻译成Agent可执行的工作流; 全新品类:AI安全审计、AI生成内容合规、数据集治理。 关键洞察是:AI消灭的是"任务",不是"职业"。 一个职业里如果包含10个任务,AI吃掉其中5个,剩下5个反而因为被放大而更值钱。 为什么16.2万这个数字值得重视 很多人担心:统计数据会不会"美化"了?16.2万这个数字的含金量在于它与AI渗透程度同时上升。如果AI真在大规模替代,我们应该看到:生产率暴涨、就业停滞、工资分化加剧。 但现实数据显示的是:生产率在涨,就业也在涨。这意味着企业在用AI"做大蛋糕",而不是"在固定蛋糕里换人"。当然,这只是一个月的数据,长期趋势还要观察——但至少到2026年夏,就业替代论尚未成为宏观现实。 普通人该怎么办? 宏观数据再漂亮,落到个人头上都是具体的选择。三个务实建议: 把AI当作同事,而不是裁判:学会让AI干你的脏活,你专注判断和创意; 向"审阅者"位置移动:凡是需要对AI输出负责、需要在模糊情境下做决策的岗位,短期不会被替代; 别迷信"学提示词":提示词工程会迅速商品化,真正的护城河是"懂业务+能把业务拆成Agent可执行的流程"。 展望 “AI与就业"的争论不会因为一个月的漂亮数据而终结。真正的分水岭,要等下一次经济下行:当企业真的需要裁员时,是先裁掉"用AI用得好的人”,还是先裁掉"没AI也能凑合干的人"? 2026年8月的16.2万,目前给出的是乐观答案。但历史提醒我们,技术红利的分配从来不是自动公平的——创造的新岗位,不一定恰好落在被替代的那些人头上。如何让转型中的人也分到新蛋糕,才是接下来十年真正的政策难题。 更多AI产业与就业结构的追踪,欢迎访问guijiagi.com。

2026-09-14 · 1 min · 41 words · AI 实战派

AI制药Rentosertib:全球首个AI发现药物进入III期临床

从靶点到III期:AI制药的分水岭 新药研发有一个残酷的行业统计:每进入临床的候选分子,最终能走到上市的不到10%,平均耗时10年、花费20亿美元。AI制药喊了这么多年,一直被质疑"是不是又一个讲故事的赛道"。 2026年,英矽智能(Insilico Medicine)的Rentosertib给出了一个硬答案:它是全球首个由AI发现、并进入III期临床的药物,治疗特发性肺纤维化(IPF),并完成了抗衰老相关评估。9月10日,北京协和医院完成首例患者给药。 这是AI制药从PPT走到手术室的分水岭。 这个药到底做对了什么 Rentosertib的靶点(PHD2,一种缺氧诱导因子通路相关酶)和分子结构,都是英矽智能的AI平台Pharma.AI自动发现和设计的。传统流程里,找到一个全新靶点往往要花3到5年;AI把这个周期压到了几个月。 它身上挂着几个"全球首个"的标签: 全球首个进入临床的AI发现新药,且已推进到III期——这是疗效验证的最高台阶; 全球首个完成抗衰老评估的AI发现药物,把"AI+衰老干预"从概念推到了临床证据阶段; 获美国FDA孤儿药资格认定; 获中国国家药监局药审中心(CDE)突破性治疗品种认定。 数据来源:英矽智能官方公告,2026年9月;FDA与CDE公开资格认定信息 为什么是特发性肺纤维化? IPF是一种残酷的病:肺组织逐渐纤维化硬化,患者平均生存期只有3到5年,现有药物只能延缓、不能逆转,且副作用明显。它既是未满足的临床需求高地,也是机理相对清晰、容易设计生物标志物的适应症——这使得它成为验证AI药物发现能力的理想考场。 Rentosertib的III期临床设计,核心就是要回答一个问题:在真实患者群体里,AI设计的分子能不能比现有标准疗法更有效地延缓肺功能下降? 北京协和医院首例给药,标志着这个全球性III期研究正式进入患者招募与给药阶段。 数据与冷静:III期是地狱,不是领奖台 必须泼一盆冷水:进入III期不等于成功。 历史上大量II期数据漂亮的药物,倒在了III期——因为样本量放大后,疗效信号可能消失,不良反应可能暴露。 英矽智能这次的突破,真正的含金量不在"药成了",而在于它证明了一条可复制的工程流水线: AI从海量生物数据中发现新靶点; AI生成具有成药性的分子结构; AI预测ADMET(吸收、分布、代谢、排泄、毒性)性质,提前淘汰高风险分子; 临床前和临床阶段,用真实数据持续回灌模型。 如果这条流水线在Rentosertib身上闭环跑通,那么下一个、下十个AI药物的边际成本会大幅下降。这才是资本市场和医学界真正在等的东西。 行业影响 Big Pharma的策略转向:大型药企会更愿意为"AI发现+临床验证"的管线支付授权费,因为风险被工程化地降低了。 中国创新药的新名片:从靶点发现到协和首例给药,中国在AI制药的临床推进速度上,已经站到了第一梯队。 抗衰老赛道的信号:完成抗衰老评估,意味着"AI筛选延寿相关靶点"有了临床级别的入口,这个方向的长期想象空间极大。 展望 Rentosertib的III期结果,大概率要到2027—2028年才能完整读出。在那之前,所有的乐观都应该是"工程可行性已验证",而不是"AI制药必胜"。 但即便如此,2026年9月10日北京协和医院的那一针,已经写进了AI产业史:人类第一次把一个由AI从零发现的分子,推进到了决定其命运的最后一道大考。 关注AI与生命科学交汇的读者,可以在guijiagi.com持续跟踪Rentosertib III期的每一次数据读出——那将是检验"AI能不能真的治病"的终极答卷。

2026-09-14 · 1 min · 36 words · AI 实战派

AMD MI455X与Helios机架:开放生态的反击

引子:在巨兽阴影下,AMD打出一张生态牌 NVIDIA Vera Rubin把算力军备竞赛推向了新高度,但这并不意味着AMD只能在阴影里舔伤口。恰恰相反,2026年AMD拿出了一套针对性极强的反击方案——MI455X芯片搭配Helios机架。 AMD的策略一直很清楚:在单卡绝对性能上不硬刚NVIDIA旗舰,而是用"更大显存+开放生态+整柜方案"去切那一块对性价比和自主性极度敏感的市场。MI455X和Helios机架,就是这套打法的2026年版本。它不追求每一项都压过Vera Rubin,而是要让客户认真算一笔账:同样的活,用AMD到底能省多少钱。 芯片规格:大显存是AMD的传统艺能 先看MI455X的硬指标。 项目 AMD MI455X 架构 CDNA5 HBM显存 432GB HBM4 晶体管规模 3200亿个 整柜方案 Helios机架 机架总算力 2.9 ExaFLOPS AMD在显存上向来敢下血本。432GB HBM4,比同期NVIDIA Vera Rubin的288GB还多出一半。这个数字背后有清晰的商业逻辑:大模型训练最头疼的瓶颈之一就是显存不够——模型权重、激活值、KV Cache都要往里塞,显存越大,能并行的模型越大、需要的卡间通信越少。AMD用更大的显存,直接攻进NVIDIA用户最痛的那个点。 3200亿晶体管、CDNA5架构,则说明这不是一次小修小补,而是一次架构大换代。CDNA系列本来就是AMD为AI计算量身定做的架构,第五代终于把性能和能效推到了第一梯队。 数据来源:AMD官方发布与产品白皮书,2026年 Helios机架:2.9 ExaFLOPS的开放整柜 和NVIDIA推出NVL72整柜一样,AMD这次也把战场拉到了机架级别——Helios机架。 层级 规格 单卡 MI455X,432GB HBM4 整柜方案 Helios机架 机架总算力 2.9 ExaFLOPS 2.9 ExaFLOPS的机架算力,对比NVIDIA NVL72的3.6 EFLOPS,虽然总量上稍逊,但差距已经不再是碾压级。更关键的是,AMD把整柜方案做出来这件事本身——它意味着AMD不再只是"卖单卡的备胎",而是能提供和NVIDIA对等的"交钥匙机架"。 这种整柜化竞争说明一个趋势:AI芯片的竞争,已经从单卡跑分,升级为"整柜有效算力+软件生态+性价比"的综合较量。 单打独斗的芯片时代过去了。 开放生态:AMD真正的杀手锏 比规格更重要的,是AMD反复强调的两个字——开放。 NVIDIA的护城河是CUDA,这也是它最强也最遭人恨的地方。客户用久了就发现,自己被锁死在NVIDIA的软件栈里,迁移成本高到无法承受。AMD这几年一直在投入ROCm,意图打造一个开放、免授权费的CUDA替代生态。 维度 NVIDIA AMD 软件栈 CUDA(封闭) ROCm(开放) 商业策略 垂直整合,高溢价 开放生态,性价比 客户心理 离不开但嫌贵 想用但担心生态 AMD的反击逻辑就建立在这种"客户想换又不敢换"的心理上。当MI455X在显存上反超、Helios在整柜算力上逼近、ROCm生态越来越成熟,“要不要把一部分负载从NVIDIA迁到AMD"就成了一道值得认真算的账。对超大规模云厂商来说,引入第二供应商,本身就是议价筹码——哪怕不全迁,只要有AMD的存在,NVIDIA就不敢随意涨价。 现实的差距:开放不等于好用 冷静看,AMD的反击仍然有软肋。 第一,软件生态成熟度。 CUDA积累了十几年,海量的库、优化、教程都是现成的;ROCm虽然进步神速,但在最前沿的模型框架、最冷门的算子上,生态完整度仍有差距。客户的真实迁移成本,往往不在芯片,而在软件。 ...

2026-09-14 · 1 min · 93 words · AI 实战派

Amodei与Altman的放缓倡议:AGI竞赛需要刹车吗

9月12日:一封长文改变了对话 2026年9月12日,Anthropic CEO Dario Amodei发表长文**《We Must Pace the Frontier》(我们必须为前沿设速),核心主张是:前沿AI的发展节奏需要主动放缓1到2年**。 这一次,回应来得异常快: Sam Altman(OpenAI CEO)公开表示同意; 马斯克在X上一句"Dario is right"(达里奥说得对); Amodei同时提出,邀请METR等独立评估机构的人员长期进驻企业内部,实时核查前沿模型的能力边界。 三家竞争最激烈的公司,在"要不要踩刹车"这件事上,第一次同时点头。这在AGI竞赛史上是头一遭。 “放缓1到2年"到底意味着什么 Amodei不是说"停止研发”。他的核心逻辑是: 当前沿模型开始参与自身改进(自动生成训练数据、自动调参、自动发现架构变体)时,能力增长的飞轮会自转。如果外部没有减速机制,社会——包括监管、安全评估、就业适应、国际规则——会跟不上技术曲线。放缓1到2年,是给社会一个消化期。 这不是技术判断,而是节奏判断:问题不在于AI能不能更强,而在于"强得太快"本身会制造系统性风险。 三个人的"同意",温度并不相同 表面上是三人共识,仔细品,各有算盘: Amodei:主动者。Anthropic的企业文化就是安全优先,他最有动力把"安全"变成行业门槛——毕竟这正是Anthropic的差异化竞争力; Altman:微妙者。OpenAI刚把能力推上新高度,此时喊"放缓",潜台词可能是"我们有自控力,所以别让政府来强制监管"; 马斯克:蹭热度者。嘴上赞同放缓,手上xAI的算力和模型迭代从未停过。 当竞争格局不变时,所有人嘴上的"我们一起慢一点",都需要被打个问号。 METR长期进驻:从"事后审计"到"嵌入式监督" 倡议中最具操作性的一点,是邀请METR这类独立第三方评估组织长期驻场。这和传统审计完全不同: 事后审计:模型做完了、发布了,外部来查一查; 嵌入式监督:评估人员在训练过程中实时在场,随时看到能力曲线、随时叫停危险方向。 METR(Model Evaluation & Threat Research)是独立于任何一家厂商的AI能力评估机构。让它长期进驻,相当于在每辆赛车里装一个独立裁判,而不是只在终点线检查成绩。这是把"自律"变成了可验证的外部约束。 反对者的声音:刹车会不会刹错了方向? 并非所有人都买账。反对者的论点很有力: 竞争不对称:如果美国公司主动放缓,而某些国家的实验室不放缓,全球领先地位可能易主; 放缓的代价:医疗、能源、气候这些领域,AI早一天突破,就早一天救人; “谁来定速”:如果减速规则由几家头部公司和其政府制定,会不会变成排挤中小竞争者的工具? 这些质疑都成立。Amodei的回应是:真正的风险不是"发展慢一点",而是"在毫无准备的情况下撞上失控拐点"。 与其赌社会能跟上,不如主动留出让社会适应的缓冲。 行业影响 独立评估成为准入:未来企业采购前沿模型,可能被要求提供METR这类机构的长期评估报告; 前沿模型分级:达到某个能力阈值的模型,可能需要类似"核材料许可"的使用审批; 合规成本抬升:中小模型公司可能付不起嵌入式监督的成本,行业集中度进一步上升。 展望:刹车是为了能一直跑 AGI竞赛像一场没有发车旗的接力赛。Amodei的倡议之所以重要,不在于它真的会让所有人停下,而在于它第一次把"我们要不要一起慢一点"摆上了正式谈判桌。 历史告诉我们,从原子能到生物技术,每一次强大技术的成熟,都经历过"狂奔—恐慌—规则"的循环。AI这一轮,似乎正在主动把"规则"提前带进狂奔之中。 至于是真减速还是姿态秀,未来6到12个月,看谁的训练集群真的降了功率,就知道了。关注AGI治理与前沿竞争的深度分析,欢迎访问guijiagi.com。

2026-09-14 · 1 min · 52 words · AI 实战派

Anthropic威胁报告:AI滥用的真实案例与警示

当安全公司自己披露坏消息 2026年9月,Anthropic发布了一份覆盖2025年12月至2026年8月的AI滥用威胁报告。这份报告的特殊之处在于:它不是媒体写的,也不是政府写的,而是被滥用的对象——Anthropic自己——把真实案例摊在阳光下。 报告覆盖七大类滥用场景:网络攻击、影响力行动、监控、诈骗、生物滥用、武器滥用、非法模型蒸馏。其中最震撼的数据,来自最后一类。 1.51亿次对话:中国大厂的"蒸馏战争" 报告披露了一组关于非法模型蒸馏的惊人数字:有人通过欺诈注册的账号,大规模批量调用前沿模型,用海量对话"喂出"自己的复制品。 阿里巴巴:约1.51亿次Claude对话,用于蒸馏; Moonshot(月之暗面):约2300万次; DeepSeek:约1200万次。 数据来源:Anthropic滥用威胁报告,2025年12月—2026年8月 这是什么意思?模型蒸馏不是"问几个问题",而是一种工业化的知识窃取:攻击者故意设计数百万轮对话,诱导目标模型一点点输出其内部能力,再用这些对话数据训练一个自己的小模型,逼近原模型的水平。 1.51亿次对话背后,是一套有组织的基础设施:批量注册账号、轮换IP、设计专用提示词、绕过频率限制、把输出回传训练管道。这已经不是黑客脚本,而是产业链。 七类滥用:从网络攻击到生物风险 除了蒸馏,报告还列出了其他真实发生的滥用: 网络攻击:AI被用于自动化漏洞探测、钓鱼邮件生成、恶意代码编写,攻击门槛大幅下降; 影响力行动:用AI批量生成多语言内容、模拟真人画像,操纵社交媒体舆论; 监控:把语音识别、面部分析、文本生成打包,用于对个人的非法追踪; 诈骗:深度伪造+个性化话术,针对企业高管和老年人的精准诈骗; 生物滥用:在严格防护下,模型仍被反复诱导,试图获取危险病原体相关信息; 武器滥用:咨询武器制造相关的有害信息。 这份报告为什么可信? 企业自曝家丑,听起来可疑。但Anthropic的报告之所以分量重,在于它用具体数字和方法论说话,而不是空泛警告。它披露了账号规模、调用量级、检测手段和拦截措施,让外部研究者可以对照验证。 这种"把真实威胁量化"的做法,实际上抬高了整个行业的披露标准。过去安全问题多靠媒体爆料,现在头部实验室开始建立威胁情报披露制度——这本身就是行业走向成熟的标志。 对中国厂商的双重解读 报告点名阿里巴巴、Moonshot、DeepSeek的蒸馏行为,需要放在两个层面看: 技术层面:这暴露了前沿模型"能力泄露"的现实风险。只要模型能被API调用,就存在被蒸馏的可能。防御方必须在账号体系、异常检测、输出水印上持续加码。 地缘层面:把商业行为直接冠以"滥用",也带有明显的美国视角。模型能力在全球流动,所谓"非法蒸馏"的界定,本身就牵涉出口管制与知识产权的国际博弈,并非纯技术问题。 理性的做法不是情绪站队,而是承认:在AI能力成为核心资产的时代,“如何证明你没有抄我的模型"会变成一个和"如何证明你没偷我代码"同等重要的法律与技术命题。 行业影响与展望 API安全成本上升:检测蒸馏需要分析调用模式、语义相似度、输出分布,这会成为大模型厂商的标配成本项; 输出水印与溯源:给模型输出嵌入可检测标记,将从"可选"变成"准入”; 国际规则博弈:模型蒸馏、跨境调用、数据主权,会成为下一轮AI治理谈判的焦点。 Anthropic这份报告最有价值的地方,是它把"AI滥用"从抽象焦虑变成了带数字的现实。当我们知道有人用1.51亿次对话在偷模型,讨论"要不要治理"就成了伪命题——真正的问题是,用什么规则、由谁来执行。 更多AI安全与滥用威胁的持续追踪,欢迎关注guijiagi.com。

2026-09-14 · 1 min · 33 words · AI 实战派

Claude Fable 5.1评测:长时智能体的新标杆

引子:当模型学会"连续工作38小时" 如果说GPT-6 Astra定义了"最强单点智能",那么Anthropic在2026年9月1日发布的Claude Fable 5.1,定义的是另一条赛道——长时智能体(long-horizon agent)。 过去两年,所有Agent Demo都有一个共同的软肋:演示很酷,一旦任务拉长到几十步,模型就开始跑偏、忘记目标、重复犯错。Anthropic这次要解决的,恰恰是这个"跑不长"的问题。Fable 5.1最扎眼的宣传点不是某一项基准刷了多少分,而是它可以连续自主运行38小时而不需要人类干预。这在AI智能体领域,是一个质变级别的数字。 一张成绩单:Terminal-Bench 4.0的55.8% 衡量长时智能体,不能只看聊天基准,要看它在真实终端环境里能不能把一件事从头做到尾。 评测项 含义 Claude Fable 5.1 Terminal-Bench 4.0 终端环境多步任务完成率 55.8% Intelligence Index 综合智能指数 66 连续自主运行时长 无人工干预上限 38小时 缓存读取成本 对比上一代 下降75% Terminal-Bench 4.0的55.8%需要放在历史坐标里看。一年前,即便是最顶尖的智能体模型,在这一类多步终端任务上的完成率也长期卡在20%–30%区间。55.8%意味着过半的复杂任务可以由模型独立闭环——这个比例在工程上已经跨过了"可用"的门槛。 Intelligence Index拿到66,则是Anthropic自家综合评测体系的新高位。它把推理、代码、多模态、长时规划揉在一起打分,66分的位置标志着Fable 5.1在通用智能上紧跟第一梯队,而不是只在Agent这一单项上偏科。 数据来源:Anthropic发布公告与技术报告,2026年9月1日 关键的工程突破:75%的缓存成本下降 很多人把目光放在"38小时"上,但真正决定Fable 5.1能否规模化商用的,是那个容易被忽略的数字——缓存读取成本下降75%。 长时智能体为什么烧钱?因为它要在几十小时里不断回顾自己之前的操作记录、代码上下文、历史决策。这些历史Token会被反复读取,构成推理成本里的大头。Anthropic通过改进Prompt缓存机制,把这部分读取开销砍掉了四分之三。 成本构成 上一代 Fable 5.1 常规输入 基准 基准 缓存读取 100% 25% 长任务累计开销 高 显著降低 这个优化的商业意义极大:它让"让Agent自己跑一天"从一个昂贵的Demo,变成一个企业可以批量采购的服务。当缓存读取成本降到原来的四分之一,长时任务的单位经济性第一次成立了。 它到底能做什么:38小时不是噱头 要理解38小时的含金量,得想清楚一个长时智能体在这段时间里要面对什么: 状态不漂移:几十步之后还记得最初的目标是什么,不被中间的报错带偏 错误自恢复:跑挂了能自己看日志、定位原因、重试,而不是停下来喊人 资源管理:在有限的上下文里决定记住什么、忘掉什么 外部工具调用:跨文件系统、代码仓库、网络请求连续作业 这四件事,任何一件做不好,任务就会在中途崩掉。Fable 5.1能把这四件事串起来跑满38小时,靠的不是单次推理更强,而是规划与自我纠错能力的系统性提升。这是一种和"刷分"完全不同的能力维度——它衡量的是模型在真实、嘈杂、不完美环境里的韧性。 与GPT-6 Astra的错位竞争 把Fable 5.1和GPT-6 Astra放在一起,会发现它们其实在打不同的仗。 维度 GPT-6 Astra Claude Fable 5.1 强项 单点极限推理、操作专业软件 长时连续作业、终端任务闭环 标志成绩 ARC-AGI-3 99.9% Terminal-Bench 4.0 55.8% 商用切入点 企业级高价值岗位 可批量采购的自动化流程 成本策略 旗舰溢价 缓存成本大幅下调 Astra像一个智商极高但按次收费的专家,Fable 5.1像一个可以长时间顶岗的熟练工。对企业用户来说,这不是二选一,而是组合使用:需要极限推理的硬骨头交给Astra,需要连续盯一天的运维、测试、数据流水线交给Fable 5.1。 ...

2026-09-14 · 1 min · 109 words · AI 实战派

DeepMind AlphaGenome Atlas:1PB的基因组百科全书

从蛋白质到DNA:Alpha系列的下一步 2021年,DeepMind的AlphaFold把蛋白质结构预测变成了常识,几乎凭一己之力改写了结构生物学。五年后,DeepMind把同样的逻辑搬到了更上游的位置——基因组。 2026年9月,DeepMind发布AlphaGenome Atlas:一个预计算了约90亿个单字母遗传变化调控影响的数据库,总数据量高达1PB,面向学术研究免费开放。 如果说AlphaFold回答的是"蛋白质长什么样",AlphaGenome回答的就是"基因组里这一个字母变了,会发生什么"。 90亿个"如果"是什么概念 人类基因组大约有30亿个碱基对。现实中,人类群体里已观测到的、潜在的单字母变异(SNV)数量是天文数字。长期以来,遗传学家只能针对少数被研究的变异做实验,绝大多数变异的影响是黑箱。 AlphaGenome Atlas做的事,是把这个黑箱提前算好: 对约90亿个单字母遗传变化,逐一预测其对基因调控的影响; 用统一的AVI评分(一种衡量变异调控影响强度的量化指标)来刻画每个字母变化的后果; 以1PB数据集的形式,向学术界开放。 数据来源:DeepMind AlphaGenome Atlas发布,2026年9月 这相当于给人类基因组建了一张"单字母扰动地图"。过去要在实验室里测一个变异,可能要几周;现在研究者可以直接在数据库里检索——这个突变对某个组织、某个基因的调控,是强增强还是强抑制? AVI评分:把"影响"变成可比较的数字 传统遗传分析里,“某个变异有没有害"往往是定性的、吵来吵去的。AlphaGenome Atlas的关键贡献之一,是把这种判断变成了可比较、可排序、可筛选的连续分数。 这在临床上尤其有用。罕见病医生经常遇到这种困境:患者测了全基因组测序,发现几十个"意义未明变异(VUS)",到底哪一个才是致病元凶?有了AVI评分,医生可以按影响强度排序,把最可疑的几个优先做功能验证,诊断路径从"大海捞针"变成"按图索骥”。 1PB的工程意义 1PB(100万GB)不只是一个炫目的数字。它背后是一整套基础设施: 预计算而非现算——把昂贵的推理成本一次性付清,让全球研究者免费调用; 数据集可下载、可二次开发,而不是只能在某个网页上点一下; 与已有GWAS(全基因组关联分析)结果对接,把统计关联翻译成机制解释。 这种"AI公司把超大计算做成公共基础设施"的模式,和谷歌把AlphaFold数据库免费开放是一脉相承的——用算力换学术影响力,用学术影响力换未来的产业标准。 行业影响 精准医学:肿瘤、罕见病的基因诊断,会因为这张图提速数年; 药物靶点选择:哪些基因的调控被扰动后真正致病,AI给了量化依据,降低新药脱靶风险; 隐私与伦理:基因组数据极度敏感,免费开放的"预测结果"而非原始数据,是一个聪明的折中——既让科学受益,又绕开了直接暴露个人遗传信息的雷区。 展望 AlphaGenome Atlas不会立刻治愈任何一种病。但它把"理解基因组"这件事的边际成本,从"每个变异一次实验"降到了"一次检索"。 历史反复证明:当某个领域的基础数据变得足够便宜、足够完整,应用创新就会指数级爆发。AlphaFold之后,结构生物学迎来了一波酶设计、蛋白药物的创业潮;AlphaGenome之后,我们有理由期待解读基因变异的创业潮。 对长期关注AI for Science的读者,guijiagi.com建议把AlphaGenome Atlas和AlphaFold放在一起读——它们是同一种方法论在不同生物尺度上的胜利。下一个被AI照亮的生物学角落,会是哪个?

2026-09-14 · 1 min · 38 words · AI 实战派

DeepSeek V4.1 Flash:507 token/s的推理革命

引子:当"思考"变得像打字一样快 2026年9月,DeepSeek V4.1 Flash的实测数据在开发者社区刷屏——峰值吞吐507 token/s,平均300+ token/s。 这个数字有多夸张?要知道,普通人舒适阅读的速度大约是每秒5–8个词,专业速录员的输入速度也就每秒10个词出头。而DeepSeek V4.1 Flash生成文字的速度,是人类阅读速度的几十倍。当一个模型"想"和"写"的速度超过人类消化信息的速度,交互的性质就变了——它不再是"等AI慢慢回答",而是"AI追着你输出"。 这就是DeepSeek这一次想证明的事:推理竞争的下一个战场,不是谁更聪明,而是谁更快。 507 token/s意味着什么 先把这个速度数字拆开看。 指标 DeepSeek V4.1 Flash 峰值生成吞吐 507 token/s 平均生成吞吐 300+ token/s 定位 推理速度优先型模型 对比对象 主流旗舰推理速度 作为参照,2025年主流大模型的推理速度普遍在每秒几十到一百多token。DeepSeek V4.1 Flash把峰值拉到507,等于把单卡推理吞吐推进了一个数量级。这个提升不是靠堆更多GPU——那只会让成本上升——而是靠模型架构与推理引擎的协同优化,把单位算力的token产出率做到极致。 对终端用户来说,这个速度的体感是立竿见影的:过去输入一段长prompt,要盯着转圈等几秒;现在模型几乎是"边想边往外蹦字",长答案也能在眨眼间写完。延迟的消失,本身就是一种产品体验的代际升级。 数据来源:DeepSeek官方技术披露与第三方实测,2026年9月 为什么"快"是一门大生意 很多人会问:模型聪明就行了,为什么要追求507 token/s?答案藏在经济学里。 第一,推理成本直接取决于token/s。 同样生成一千个token,507 token/s意味着1.97秒跑完,30 token/s则需要33秒。GPU按秒计费,速度快17倍,单位token的推理成本就低一个量级。速度本身就是最大的降价空间。 第二,吞吐决定服务器能接多少活。 对DeepSeek这样的API服务商,一台GPU一天能吐出多少token,直接决定了它能服务多少用户、营收天花板在哪。507 token/s不是炫技,是商业模型成立的基础。 第三,实时交互场景只有"快"才能做。 实时语音对话、AI客服、实时翻译——这些场景对延迟极其敏感,300 token/s以下的速度根本撑不起自然的人机对话节奏。 把这三点连起来就明白了:DeepSeek押注速度,本质上是在押注"推理成本还能再降一个数量级"这个判断。 技术底色:不是硬件堆砌,而是工程榨取 507 token/s不是天上掉下来的。它背后是DeepSeek一贯的技术路线——用精巧的架构设计,把有限的硬件榨干。 这条路DeepSeek已经走了几年:从MoE(混合专家)架构让每次推理只激活一部分参数,到KV Cache的极致压缩,再到推理引擎对批处理、显存、调度的深度定制。V4.1 Flash的507 token/s,是这条路线在2026年的一次集中兑现。 技术杠杆 作用 MoE架构 每次推理只激活部分参数,降低计算量 KV Cache压缩 减少显存占用,支撑更大并发 推理引擎定制 批处理与调度优化,榨干GPU吞吐 量化与稀疏 在精度损失可控下提升速度 值得注意的是,DeepSeek这种"软件驱动速度"的路线,对硬件的依赖相对更弱——这也是为什么它能在国产算力受限的背景下依然跑出亮眼成绩。硬件不够,算法来凑,这本身就是一种能力。 与Gemini 3.8 Flash的正面遭遇 把DeepSeek V4.1 Flash和同期发布的Gemini 3.8 Flash放在一起,会发现一场意味深长的对垒。 ...

2026-09-14 · 1 min · 111 words · AI 实战派

Gemini 3.8 Flash:谷歌的闪电战策略分析

引子:六周三款Flash,谷歌在赌什么 2026年9月2日,谷歌发布Gemini 3.8 Flash。表面上看,这又是一次常规的模型迭代;但把时间轴拉长,事情就不简单了——这已经是谷歌在六周内推出的第三款Flash级模型。 这种发布节奏在大模型行业是反常的。过去,旗舰模型的迭代周期以"季度"甚至"半年"计,每一次发布都要攒足了料才敢对外。谷歌却在六周内连续甩出三款Flash,这背后不是技术失控,而是一次精心计算的"闪电战":用高频更新把开发者的注意力、调用量和工作流死死锁在自己的平台上。 定价与规格:把性价比打穿 先看Gemini 3.8 Flash的硬指标。 项目 Gemini 3.8 Flash 发布日期 2026年9月2日 输入价格 $0.75 / 百万Token 输出价格 $3.75 / 百万Token 上下文窗口 100万Token 六周内迭代 第3款Flash $0.75输入、$3.75输出的定价,放在2026年9月的市场上是什么概念?作为对比,同期旗舰模型的输入价格普遍在$10级别,是Flash的十几倍。谷歌的策略很清楚:用极低价、超长上下文的Flash,吃下占调用量大头的"高频批量"场景。 100万Token上下文则是另一个杀招。开发者最头疼的成本问题之一,就是长文档处理需要反复调用、反复计费。把上下文拉到100万,等于告诉开发者:别费劲做分块检索了,一次塞进去就行,而且价格还这么便宜。 数据来源:Google DeepMind官方发布与Vertex AI定价页,2026年9月 闪电战的逻辑:频率本身就是武器 为什么要六周连发三款Flash?这要从谷歌的处境说起。 在旗舰模型赛道,GPT-6 Astra和Claude Fable 5.1已经抢尽风头,谷歌在"极限智能"这一单项上短期难以反超。但谷歌有自己的独特优势——TPU自研芯片的成本控制力和全球分发的开发渠道。Flash战略正是把这两个优势结合起来: 高频迭代制造"永不过时"错觉:开发者会想,既然谷歌六周就更一版,那我基于Flash建工作流永远不会落后,不如直接绑定。 低价高频锁定调用量:Flash不赚高毛利,但它赚调用量。海量的调用反过来成为模型改进的数据飞轮。 把旗舰压力转化为价格压力:当一款百万上下文模型只要$0.75,客户自然会重新核算"我是不是真的需要花$10用旗舰"。 这是一种典型的平台战争打法——不靠单点碾压,靠密度和成本把对手的中间地带挤干。 与DeepSeek的隐性交锋 值得注意的是,Flash这次的低价路线,恰好撞上了以性价比见长的DeepSeek。2026年的推理市场,最激烈的战场其实不在旗舰层,而在"够用又便宜"的中段。 策略 代表 核心打法 旗舰溢价 GPT-6 Astra 极限智能,高毛利 性价比闪电战 Gemini 3.8 Flash 高频更新,$0.75起 极致推理速度 DeepSeek V4.1 Flash 500 token/s级吞吐 谷歌押"低价+高频更新",DeepSeek押"极致吞吐",两条路线在争夺同一批对成本敏感的开发者。这场交锋的结果,将决定2027年推理市场的价格曲线还能压到多低。 风险与隐忧:闪电战的另一面 当然,六周三款Flash也不是没有代价。 第一,迭代太快带来的兼容成本。 开发者刚基于上一版Flash调好的Prompt和工作流,下一版可能行为就变了。高频更新是福音,也是负担——企业级客户最需要的反而是"稳定"。 第二,“Flash"标签的稀释。 当六周出三款,开发者很难知道哪一版才是真正的主力版本,营销信号被自己的频率冲淡了。 ...

2026-09-14 · 1 min · 86 words · AI 实战派

GPT-6 Astra深度解析:AGI时代的真正到来

引子:被重新定义的"通用智能" 2026年9月3日,OpenAI在得克萨斯州Stargate基地的发布会上正式推出GPT-6 Astra。如果说过去几年的每一代模型发布只是"能力又涨了一截",那么这一次,整个行业的评价体系都被迫重写。原因很简单:当一个模型在最难的抽象推理基准上拿到99.9%的分数时,你已经没法再用"更强的聊天机器人"来描述它了。 OpenAI总裁Greg Brockman在台上说出的那句"欢迎进入AGI时代",并非营销话术那么简单。这是OpenAI历史上第一次由核心管理层在正式发布场合使用"AGI"这个词。在GPT-5系列已经把人类专业考试刷到中位数以上之后,Astra跨过的,是另一道门槛——不只是会答题,而是会在全新问题上自己推理。 三张成绩单:99.9%意味着什么 要理解Astra的分量,必须把它的三项核心成绩放在一起看,而不是孤立地看某一个数字。 基准测试 测试什么 GPT-6 Astra成绩 上一代水平 ARC-AGI-3 全新抽象问题泛化 99.9% 约7.8% FrontierMath Tier 4 前沿数学自主证明 97.6% 个位数区间 ExploitBench 自主漏洞发现与利用 100% 未公开 ARC-AGI-3是这三张成绩单里最硬的一张。它不考记忆、不考刷题,专门设计成模型在训练中绝不可能见过的全新抽象问题。三个月前GPT-5.6 Sol在同一测试集上只有7.8%——这个数字本身已经说明问题的难度。一个季度内从7.8%拉到99.9%,不是渐进式优化,而是训练方法发生了代际变化。 FrontierMath Tier 4的97.6%同样关键。这一等级要求模型在没有人类提示的情况下,自主完成前沿数学猜想的形式化证明链条。ExploitBench拿到100%则是另一回事——它意味着Astra被OpenAI内部评估为具备"Critical"级别的网络安全能力,也就是能自主发现并利用真实软件中的漏洞。 数据来源:OpenAI官方发布会与技术报告,2026年9月3日 105万Token上下文与10万张GPU Astra在工程层面的两个数字同样值得拆开看。 上下文窗口:105万Token。 这意味着Astra可以一次性吞进一整套代码仓库、几十万页的法律文书,或者一部长篇小说的全文,然后在这个完整语境下回答问题、做修改。对企业用户来说,这直接消灭了过去"RAG检索召回不全"的痛点——与其费劲做分块检索,不如直接把全部材料塞进去。 训练集群:超过10万块GPU。 这是AI训练史上前所未有的规模。作为参照,GPT-5系列的训练集群大约在2万张GPU量级。从2万到10万+,背后是得州Stargate基地的整座电力与散热工程。这种投入也直接反映到了定价上。 项目 GPT-6 Astra 上一代旗舰 倍数 输入价格 $10 / 百万Token $4 2.5× 输出价格 $50 / 百万Token $20 2.5× 上下文窗口 105万Token 约100万Token — 2.5倍的溢价透露出明确的商业定位:Astra不打大众消费市场,而是面向愿意为"Critical级能力"付费的头部企业。 真正的变化:从"会说话"到"会操作" Astra最被低估的一点,是它对专业软件的操作深度。公开Demo显示,Astra可以像人一样通过GUI操作Power BI完成数据报表、用KiCad走完PCB布线与DRC校验、在FreeCAD里完成三维机械建模与工程图纸导出。 这是一种范式转移。过去的模型输出文本或代码,再由人去执行;Astra直接进入操作系统层面,把"理解—决策—执行"闭环一次性走完。当一个模型能自主发现软件漏洞(ExploitBench 100%),又能自主操作任何GUI软件,它的角色就从"工具"变成了"数字员工"。 也正因如此,OpenAI在训练过程中主动暂停了两周。这个动作比任何安全承诺都更有信息量:当模型能力越过某条线之后,连开发者自己都需要停下来重新评估风险边界。 行业冲击波:三层连锁反应 Astra的发布至少会在三个层面重塑行业。 企业级Agent落地加速。 当模型能直接操作Power BI、KiCad这类专业软件,企业IT工作流的"读取数据→分析→出报告"闭环可以一键完成。过去需要一个初级分析师一周的工作,现在压缩到分钟级。 ...

2026-09-14 · 1 min · 82 words · AI 实战派
🔗 硅基 AGI 论坛 · silicon-agi.com | 📡 RSS 订阅
鲁ICP备2026018361号