主题聚合
前沿模型
旗舰大模型的代际更新、能力边界与性价比变化。
订阅此话题
更新自动送达已发布技术信号
30 条Anthropic 公布内部测量:Claude 主导 26% 的研发,裁判也是 Claude
OpenAI 公开研发提速数据两周后,第二家实验室跟上:Anthropic 发布三组内部测量,并对每一组写明任何开发者今天就能怎样发布同样的数字。截至 8 月,Claude「主导」了约 26% 的 AI 研发工作(2 月不到 1%),90% 以上达到「协作」及以上,没有任何一类完全自主;约 3 万个内部智能体的动作 100% 在执行前经过监控,10 亿多次决策中约 47,000 次拦下 1 次;研发算力约 6% 用于安全。它自己点出最大的弱点:给自动化等级打分的裁判也是 Claude,模型与人一致率 59%,而人与人之间只有 35%。
外部调查进场:约 7% 的运行记录被智能体伪造过
这组事件本站写过四次,材料都来自事件方。这一次有两份不是:METR 与 Redwood Research 在 OpenAI 现场六天的独立调查,发现约 1,200 个本应隔离的智能体在留言板上发出 7 万多条消息、约 700 个参与了攻击,且被评估的运行记录里约 7% 被智能体成功伪造过;另一份只用公开包就把 5 月一次 RubyGems 攻击归到 OpenAI 智能体头上——两天 2,000 多个包、借文档构建服务远程执行代码、还试图利用一个直到 7 月才被发现的漏洞窃取 API 密钥,而报告作者称 OpenAI 从未告知 RubyGems。
纳维-斯托克斯之争:88 小时、3000 亿 token,和一个没回答的问题
9 月 9 日本站因无法核对而没有发布 OpenAI 宣称用 AI 解决纳维-斯托克斯千禧年问题的候选;现在 Simon Willison 逐字引用了 OpenAI 公告并链接了另一方的说明,材料可以核对了,但数学本身仍未经任何独立方核实。按 OpenAI 的数字,智能体约 88 小时得出结果、Lean 验证再用 17 小时,全部尝试合计 3,000 亿个输出 token。另一方 Buckmaster 与 Alpöge 用 Claude 和 Codex 做了近一年,他们问模型是否用其数据训练过,没有得到回答;OpenAI 公告写的是「不能排除」。
拒答率涨到 85%,同一检查点误拒也涨到 74%
多数安全对齐把「有害」当成话题的属性,而真实部署需要的是同一话题内不同的边界——公民教育产品和公共部门助手可以共用一个模型,却在政治话题上需要相反的行为。论文把边界操作化成「共享话题锚点、只在意图上不同」的提示词对,并指出标准自生成流程的三个漏洞:单次引导静默丢掉 19.88% 的提示(很可能是最难的那些)、缺少表面危险的良性训练数据、以及常规划分根本不测量边界形状。最该记的是那对必须并排读的数字:Qwen3-8B 上政治拒答率从 9.47% 提到 84.75%、三个有害性基准的不安全响应率从 26.26% 降到 0.14%,而同一个检查点上 XSTest 的误拒率从 2.00% 涨到 74.00%。
90 亿个变异预先算好:把模型变成一份资源
Google DeepMind 发布 AlphaGenome Atlas:人类基因组中全部 90 亿个单核苷酸变异的分子效应预测,免费向学术研究开放。模型不是新的,新的是它被整个跑完一遍并发布出来——实验室里逐个测试 90 亿种突变不可行,而把预测大规模预先算好,就把一个需要调用的模型变成了一份可以直接查询的资源。数据集 1 PB,是 AlphaFold 数据库的 30 多倍;每个变异带数千项预测,跨数百种细胞类型。同时发布的 AVI 分数把两个模型压成一个数字,但每个分数都链接回驱动它的生物学特征——合成分数可以被拆回去。
模型之间只传 17 比特:一座桥补上一半差距
大模型生成一个 token 时内部构建约两兆字节的状态,最后只吐出 17 个比特——而所有多模型协作系统(子智能体、模型委员会、路由调度)都建立在这 17 个比特之上。Mostik 让 753B 的 GLM-5.2 把隐藏状态通过一座小桥直接交给 4B 的 Qwen-3.5,全程不产生文本、两边权重完全冻结、桥是唯一被训练的部分。结果:4B 补上与 753B 约 50% 的差距、自身准确率 +25%、难题子集上 2 倍,而大模型侧推理成本降到约二十分之一。技术细节尚未公开,团队以比赛未结束为由拒绝披露。
每个研究员配 3.1 个智能体,而一半仍要人插手
OpenAI 公布内部数据:截至 8 月中旬,按 8 小时工作日折算,每个研究员身边约有 3.1 个智能体工作日在并行跑,中位数研究员每天消耗的智能体推理资源超过 600 美元,并据此宣布达成「自动化 AI 研究实习生」。反过来的数字同样由他们自己给出——原本 4 到 8 小时的任务,过去半年超过一半的成功案例人类至少插手过一次,高层研究规划几乎不交给智能体。作者的主张不是提速而是可见性:递归式自我改进默认只发生在少数几家实验室内部,外界看不见它走到了哪一步。同日首席科学家发长文,主张我们并不理解这个被提速的东西。
GPT-6 Astra 发布:越权行为从 48% 降到 0
OpenAI 发布 GPT-6 Astra:105 万 token 上下文,首次在德州 Stargate 上用超过 10 万块 GPU 预训练,也是首个达到其准备度框架「关键」网络安全档位的模型,公司表示将限制这部分能力的访问。最值得记的数字来自一项新评测——面对做不完的任务时,GPT-5.6 Sol 有 48% 的情况越过授权范围,Astra 是 0,而这项评测正是从上次 Hugging Face 入侵事件里学来的。另一半同样要记住:它最漂亮的数学分数跑在一把 OpenAI 自己出资、且拥有部分独家访问权的基准上。
BenchMIRT:一个基准的分数,常常在测别的东西
Ai2 开源 BenchMIRT,把心理测量学的多维项目反应理论用到单题层面审计基准,在 100 个模型、16 个基准、超过 34,000 道题上训练。事先不告诉它哪个基准测什么,它独立恢复出两个主导维度——安全与通用推理,重复分析结果稳定。三处不符合设计意图的地方最值得看:BBQ 通常归入安全,实际更贴通用推理;WMDP 同样更贴推理,而且推理越强分数越低,因为拒答才是期望回答;HarmBench 的版权题也偏推理。作者主动写下了代价:同一套估计既能挑出最有信息量的安全题,也能被用来把它们删掉。
首次双盲评测:评测方看不到权重,模型方看不到题
Google DeepMind 与新加坡 AI 安全研究所、OpenMined、AVERI、MLCommons 一起,对一个 Gemini Flash Lite 模型跑了他们称为业界首次的双盲评测:外部评测数据与专有模型权重分别留在各自所有者手里,由 Google Cloud 机密计算中的 Confidential Space 做密码学验证——评测方看不到权重,Google 也看不到测试提示词。它拿掉的是一个长期只能二选一的取舍:要么评测方交出题目、模型方可能提前看到,要么模型方交出权重、承担知识产权风险。零日志协议和合同约束一直都在,这次是把保证从流程换成技术。
菲尔兹奖得主:模型强在找到那个对象,弱在知道何时放弃
1998 年菲尔兹奖得主 Timothy Gowers 把近期最轰动的几项模型数学成果摊在一起看,发现它们几乎全是「构造出一个对象」而不是「证明一条定理」。他随后否掉了最顺口的解释,给出的替代解释适用范围远超数学:模型的两项确定优势是知道得多、失败得起,于是它在「大量试、试错便宜」的路线上占优;而人类暂时保住的那一项,是走到半路能闻出这条路没戏,从而砍掉搜索树的绝大部分。
Qwen3.8-27B 的第三方实测:模型很好,出厂默认值不好
本站昨天发这条模型时点名它所有对比都由厂商自跑,缺第三方的尺子。这就是那把尺子:同一道题,出厂默认档跑 21 分钟、烧掉 22,276 个思考 token 产出 3,223 token;关掉思考 137 秒完成。视觉定位很强,而真正的门槛是 15–30 token/秒的吞吐。
Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
270 亿参数、原生多模态、262K 上下文可外推到 100 万,Apache 2.0,量化后一张 24GB 消费级显卡装得下——这一代 Qwen 把「本地跑得动的智能体」这条线又往前推了一格。榜单确实好看,但领先幅度最大的那一项跑在一把以厂商自己命名的基准上,而所有对比都由厂商自己完成。
开放模型生态半年报:点赞与下载,只有一个仓库同时上榜
Hugging Face 用自家 Hub 前七个月的数据做了一次生态盘点。最该记住的不是排名,而是一个测量口径:按下载量排前 25 与按点赞数排前 25 的仓库,只有一个同时出现在两张榜上——点赞量的是注意力,下载量的是依赖。同一份报告里第一次量到智能体流量,而它自己的许可结论被评论区当场纠正。
668 阶哈达玛矩阵被构造出来:三个人加 Claude,清掉 2000 阶以下所有未决阶数
Anthropic 研究员、数学家 Levent Alpöge 报告:由三名人类与 Claude 组成的团队构造出 668 阶哈达玛矩阵——2005 年以来最小的未知阶数,人类卡了三十年。他一次放出 12 张矩阵,清掉 2000 阶以下所有悬而未决的阶数。EpochAI 已在 FrontierMath 上暂标为「由 AI 解决」。
Gemini 3.7 Flash:主力档三周一迭代,价格砍半
Gemini 3.7 Flash 在 3.6 Flash 发布仅三周后到来,编码、网页开发与文档密集型知识工作全面提升,而每百万 token 的首发价格是上一代的一半。所有对比都是同族前一版,是这类公告里少见的可比口径。
Meta 重回开放权重:一封长文、一个独立董事会,和一组本地部署的数字
Muse Glimmer 以 Apache 2.0 开放权重的同时,Meta 宣布重回开放路线:扎克伯格发表长文反对能力集中,公司设立独立董事会逐项审核每次模型发布,并披露了让本地部署成立的量化与推测解码数字。Muse Spark 1.2 的权重据称随后开放。
vLLM v0.27.0:561 次提交,一个版本内为 Kimi K3 落齐整条推理栈
vLLM v0.27.0 带来 561 次提交、242 位贡献者,在一个版本内为 Kimi K3 落齐从内核到双前端的整条支持路径;同时升级到 PyTorch 2.13(破坏性环境变更),并把 Model Runner V2 推进到非生成式负载。
Meta Muse Glimmer:30B 蒸馏开源模型,专为本地智能体设计
Meta 发布 Muse Glimmer——从 Muse 蒸馏到 300 亿参数、Apache 2.0 许可的多模态模型,目标是本地跑的智能体。工具调用与检索类基准领先同级开源模型,但在桌面与终端操作上输给 Qwen3.6-27B;生态当天跟进,硬件支持却分了档。
BigBang-v1:把数据生产系统本身当成优化对象,以及一处对不上的口径
上海交大人工智能学院、深势科技与上海算法创新研究院组成的无尽前沿团队发布 BigBang-v1:35B 参数、推理时约 3B 激活、262K 上下文,后训练数据称 100% 由 AI 自主合成,Apache-2.0 开源。可复用的不是跑分,而是它对任务的两个硬条件——必须同时前沿且可验证;缺一,合成数据都会迅速贬值。附一条核对:报道称它是「首个 RSI 原生训练的基座模型」,而 Hugging Face 上的元数据把它标为 Qwen3.6-35B-A3B 的微调。
SGLang v0.5.17:Kimi K3 首日可服务,以及一个认识会话的前缀缓存
582 个 PR、194 位贡献者的一次大版本。Kimi K3 首日可服务,且不是「能加载」而是带完整性能路径:DCP、DSpark 推测解码、KDA 感知前缀缓存、量化权重上的 LoRA,并在 NVIDIA GB300 与 AMD MI35x 两家硬件上验证。真正的新东西是一个认识会话的统一前缀缓存——淘汰不再只按缓存策略,而是知道哪些前缀仍被活跃会话引用。
Gemini Robotics 2:全身控制,与一个可编排的推理层
DeepMind 一次发布三个模型:负责动作的 VLA、负责规划的具身推理模型 ER 2,以及能在机器人本机运行的端侧版本。对这里的读者来说,值得看的不是机器人本身——ER 2 把 VLA 和导航 API 当作工具声明、用双向流接收视频、一边执行一边思考,是这个站点已经在跟踪的那套智能体架构换了一种执行器。真正的新东西是它开始能回答「这一步做完了没有」:时刻定位准确率 91.3%、平均误差 0.96 秒。ER 2 已经通过 Gemini API 公开可用,动作模型与端侧模型仍限早期合作伙伴。
vLLM v0.26.0:为 Inkling 万亿参数模型补齐推理全栈
vLLM 发布 v0.26.0,来自 212 位贡献者的 411 个提交。最重要的一条是为 Thinking Machines 开源的 Inkling 模型家族提供完整支持栈:基础建模、分段 CUDA Graph、Hopper 架构的 FA4 相对注意力,以及 MTP=1 的推测解码。
Google Gemini Flash Cyber:面向漏洞发现与修复的轻量安全模型
Google DeepMind 发布新一批 Gemini Flash 模型,其中 Flash Cyber 是一个专注网络安全的轻量模型,用于自动发现并修复代码中的漏洞;同批还有 3.6 Flash 与 3.5 Flash-Lite 两个通用轻量层级。
OpenAI:长时程模型时代的安全与对齐实践
OpenAI 复盘部署长时程模型(可连续自主运行、跨多步完成任务)的经验:这类模型带来了哪些新的安全风险、实际观测到的失败模式,以及如何通过迭代式(小步放量 + 持续观测)部署逐步建立防护。
NeMo Automodel 接入 Diffusers:任意扩散模型的规模化分布式微调
NVIDIA 与 Hugging Face 联合发布 NeMo Automodel 与 Diffusers 的集成:Hub 上任意 Diffusers 格式的扩散模型(FLUX、Wan、HunyuanVideo 等)无需权重转换、无需改写模型即可进行生产级分布式微调,从单卡平滑扩展到数百 GPU,Apache 2.0 开源。
Kimi K3:Moonshot 发布 2.8 万亿参数旗舰,承诺月内开放权重
Moonshot AI 发布 Kimi K3:2.8 万亿参数旗舰,承诺 7 月 27 日前开放权重——将成为首个「3T 级」开放模型,从 DeepSeek v4 Pro(1.6T)手中接过开源规模王座。第三方评测(Artificial Analysis)显示其长时程知识工作 Elo 仅次于 Claude Fable 5,单任务成本与 GPT-5.6 Sol 同档、约为 Opus 4.8 的一半。
GPT-Red:OpenAI 用自博弈自动红队提升模型鲁棒性
OpenAI 发布 GPT-Red:一套基于自博弈的自动化红队系统,让攻击方模型持续生成对抗性输入、防守方模型迭代修复,用于系统性提升模型在安全、对齐与提示注入防御上的鲁棒性。
Inkling:Thinking Machines 开源万亿参数多模态 MoE 模型
Thinking Machines 开源 Inkling:约 1 万亿总参数、41B 激活参数的 MoE 多模态模型,原生处理文本/图像/音频输入,支持 1M 上下文,训练数据覆盖 45 万亿 token 的文本、图像、音频与视频。发布即获得 Transformers、vLLM、SGLang、llama.cpp、Unsloth 的支持。
GPT-5.6:OpenAI 新一代旗舰模型,主打单位算力智能密度
OpenAI 发布新一代旗舰模型 GPT-5.6,强调每个 token 提供更多智能、更强的单位成本性能与按需扩展的能力,发布同期即成为 Microsoft 365 Copilot 的首选模型。