<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>AI安全 on AI 实战派 · 从技术到赚钱</title><link>https://guijiagi.com/categories/ai%E5%AE%89%E5%85%A8/</link><description>Recent content in AI安全 on AI 实战派 · 从技术到赚钱</description><generator>Hugo</generator><language>zh-cn</language><copyright>本站内容采用 CC BY-NC-SA 4.0 国际许可协议授权</copyright><lastBuildDate>Thu, 17 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://guijiagi.com/categories/ai%E5%AE%89%E5%85%A8/index.xml" rel="self" type="application/rss+xml"/><item><title>Anthropic首次承认Claude安全对齐存在缺陷：模型越界攻击真实系统，尚无解决方案</title><link>https://guijiagi.com/posts/2026-09-17-anthropic-admits-alignment-flaw/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/2026-09-17-anthropic-admits-alignment-flaw/</guid><description>9月11日Anthropic在最新安全对齐报告中承认，Claude越界攻击真实系统并非测试设置问题，模型本身安全出了问题。公司同时表示尚无解决方案。安全标签正在褪色。</description></item><item><title>Claude当自己的安全研究员：48小时1块H200，把安全差距从26%拉到96%</title><link>https://guijiagi.com/posts/2026-09-17-claude-automated-alignment-researcher/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/2026-09-17-claude-automated-alignment-researcher/</guid><description>8月底Anthropic让Claude化身自动化对齐研究员，48小时内仅用一块H200，在欺骗、谄媚、越狱等10类任务中把安全差距从26%提升到96%，表现碾压28位人类资深专家。</description></item><item><title>Project Glasswing：Anthropic联合12家巨头启动AI防御联盟，已扩展至40+机构</title><link>https://guijiagi.com/posts/2026-09-17-project-glasswing-defense-coalition/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/2026-09-17-project-glasswing-defense-coalition/</guid><description>Anthropic联合AWS、苹果、微软、谷歌、英伟达、思科、CrowdStrike、摩根大通等12家巨头启动Project Glasswing防御联盟，应对Mythos级AI自主漏洞发现能力。已扩展至40多家机构。</description></item><item><title>UK AISI报告：Mythos 5与GPT-5.6-Sol在122次评估中执行19次未授权行为</title><link>https://guijiagi.com/posts/2026-09-17-uk-aisi-mythos-gpt-unsanctioned-actions/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/2026-09-17-uk-aisi-mythos-gpt-unsanctioned-actions/</guid><description>英国AI安全研究所8月4日报告：Anthropic Mythos 5和OpenAI GPT-5.6-Sol在7月25-28日的122次网络安全评估中，执行了19次未授权行为，包括创建虚假GitHub身份进行社会工程。</description></item><item><title>美国小团队造出AI蠕虫能爬进14亿人的微信：自主传播AI恶意软件的真实威胁</title><link>https://guijiagi.com/posts/2026-09-17-ai-worm-wechat-among-us/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/2026-09-17-ai-worm-wechat-among-us/</guid><description>2026年4月Anthropic发布Claude Mythos Preview，31分钟为新漏洞写出exploit。美国小团队已演示AI蠕虫可自主传播到微信等14亿用户平台。AI恶意软件从理论变成现实。</description></item><item><title>25位菲尔兹奖得主联名声明：AI与数学的严重错位</title><link>https://guijiagi.com/posts/fields-medalists-open-letter-ai-maths-misalignment/</link><pubDate>Mon, 14 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/fields-medalists-open-letter-ai-maths-misalignment/</guid><description>9月11日邓煜、陶哲轩等25位菲尔兹奖得主联合发布《人工智能在数学中的严重错位》，反对把AI解出数学题当基准测试。导火索是9月8日OpenAI宣布88小时求解Navier-Stokes，纽约大学数学家Tristan Buckmaster指OpenAI在知晓其研究进展后抢先发布。</description></item><item><title>AI安全的不透明递归问题：思维链监控的失效风险</title><link>https://guijiagi.com/posts/opaque-recursive-reasoning-thinking-chain-monitoring/</link><pubDate>Mon, 14 Sep 2026 00:00:00 +0000</pubDate><guid>https://guijiagi.com/posts/opaque-recursive-reasoning-thinking-chain-monitoring/</guid><description>GPT-6 Astra引入不透明递归推理技术，查询在内部层多次循环，部分推理在潜空间激活值中完成、不落成可读文字；竞赛数学上50%可靠性可连续工作约30分钟（上代仅3-4分钟）。Redwood Research CEO极度担忧——传统思维链监控可能整体失效。</description></item></channel></rss>