模型 · 第 2026-08-15

Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名

270 亿参数、原生多模态、262K 上下文可外推到 100 万,Apache 2.0,量化后一张 24GB 消费级显卡装得下——这一代 Qwen 把「本地跑得动的智能体」这条线又往前推了一格。榜单确实好看,但领先幅度最大的那一项跑在一把以厂商自己命名的基准上,而所有对比都由厂商自己完成。

量子位2026-08-15值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

前沿模型端侧 AI多模态AI 智能体

记录

信号正文

2026-08-14,阿里以 Apache 2.0 协议开源 Qwen3.8-27B。27B 是社区呼声最高的尺寸,原因很实际:量化之后,24GB 显存的 RTX 3090 / 4090 这类显卡能整卡装下,而上下文没有跟着缩水——原生 262K token,通过 YaRN 可外推至 100 万。

值得记的是架构,不是尺寸

模型共 64 层,其中 48 层用 Gated DeltaNet 线性注意力,16 层保留完整注意力,大致按「三层线性 + 一层完整」的节奏循环。线性注意力压住长序列的计算与缓存开销,完整注意力隔几层做一次更充分的信息交互——262K 原生上下文是这个配比换来的,不是堆出来的。这个骨干与 Qwen3.5 / 3.6 同源,ms-swift 的发布说明也是这么描述的。

两个面向长任务的开关同样值得记:

  1. reasoning_effort 分 xhigh / medium / low 三档,复杂代码与长程智能体任务拉高,简单问答降下来换速度和成本;Thinking 也可以整个关掉。
  2. preserve_thinking 默认开启,前几轮「怎么想的」会留在后续上下文里。编码智能体连改十几个文件时,可以沿着前面的决策继续走,同时更好地复用 KV 缓存。

补充(2026-08-17):第一份第三方动手实测出来了,而它指向的正是第一条那个默认值。同一道画图题,出厂的 xhigh 默认档跑 21 分钟、烧掉 22,276 个思考 token,关掉思考只要 137 秒;LM Studio 默认 8,192 的上下文会被思考过程整个吃光。先用 low 或直接关掉思考跑,再决定要不要拉高。详见延伸阅读那条。

生态当天就跟上了

  • Ollama v0.32.12(08-14)加入 qwen3.8:27b,并为 Apple Silicon 单独提供了 qwen3.8:27b-mlx 构建;次日的 v0.32.13 补上开发者指令支持。
  • ms-swift v4.5.0(08-14)同日适配训练与后训练侧。
  • 官方侧接上了 Transformers、vLLM、SGLang 与 TokenSpeed,Hugging Face 上量化版本入口同时开放。

首日可服务这件事本身已经不新鲜了——从 Kimi K3 到 Muse Glimmer,本站记过好几次;值得注意的是这次连 Apple Silicon 的专用构建都在同一天。

榜单很好看,但尺子是谁的

厂商公布的对比里,Qwen3.8-27B 在多项评测上超过 Claude Opus 4.6 Max:

  • SWE-bench Pro:领先 8.3 分
  • QwenSWEBench:领先 15.2 分
  • CoWorkBench:70.7 对 68.2
  • OSWorld-Verified(电脑操作):84.3 对 72.7
  • AndroidWorld(手机操作):81.9 对 62.0

领先幅度最大的那一项,跑在一把名字里带着厂商自己的基准上。 本站《模型与输出评估》里那条判据在这里几乎是逐字适用的:一个数字能不能横比,先问这把尺子有没有量过别人。QwenSWEBench 领先 15.2 分,而第三方的 SWE-bench Pro 领先 8.3 分——两个数差了将近一倍,方向一致但幅度不一致,而且所有对比都是厂商自己跑的,不是第三方复现。

浏览器操作 WebArena-Verified 从上一代的 48.8 提升到 64.8,是这批数字里口径最干净的一个:同族前一版,同一项评测。

社区实测是用户报告,不是评测

量子位那篇里引了两条网友实测,值得读但要按用户报告对待:一位把 FP8 版本放在单张 GH200 上并发跑 10 个请求、每个最高输出 16K token、上下文拉到 262K,首批流式 token 基本在 10 毫秒内返回;另一位丢给它一部 1935 年的 11 分钟影片,让它识别 96 个带时间戳的事件并逐字引用画面文字,157 秒完成、时间点误差约 2 秒。没有对照组、没有重复运行,所以它们说明的是「跑得起来」,不是「跑得比谁好」。

一处可核对的口径差

官方称千问已累计开源 460 余个模型、全球下载超 30 亿次、衍生模型数超 30 万个。同一周 Hugging Face 那份生态报告独立数出来的是 Hub 上 151,448 个 Qwen 衍生模型。两个数字差了大约一倍,但并不矛盾——一个统计跨平台(含魔搭),一个只统计 Hub。知道它们口径不同,比记住哪个更大有用。

为什么是现在

为什么重要

本地能跑的那一档模型,长期以来的代价是上下文短、多模态缺失或智能体能力弱。27B 这个尺寸同时给了 262K 原生上下文、原生视觉理解和可调的推理深度,而且是 Apache 2.0——这把「先看看能不能本地跑」从妥协方案变成了默认起点。同一周 Hugging Face 的生态报告给了这件事的宏观背景:小模型拿走 83% 的下载量,而 Qwen 是社区衍生模型最多的基座。

背景

技术背景

64 层骨干中 48 层为 Gated DeltaNet 线性注意力、16 层为完整注意力,按三比一循环,与 Qwen3.5 / 3.6 同源。原生 262K token 上下文,经 YaRN 外推至 100 万。原生多模态,覆盖图片、文档、图表与视频理解。reasoning_effort 提供 xhigh / medium / low 三档并可完全关闭 Thinking;preserve_thinking 默认开启,把前几轮推理保留进后续上下文以复用 KV 缓存。Apache 2.0,量化后可在 24GB 显存整卡装载,推理路径覆盖 Transformers、vLLM、SGLang、TokenSpeed、Ollama(含 MLX 构建)与 ms-swift。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

手里有一张 24GB 消费级显卡或大内存 Mac、想在本地跑长上下文编码智能体的开发者在自托管与云 API 之间做取舍、需要知道本地档位上限已经推到哪里的平台团队要读厂商发布公告并决定换不换的技术负责人——尤其是需要区分第三方基准与自命名基准的那一类关心线性注意力与完整注意力混合骨干如何换来长上下文的推理工程师
可能影响的领域
本地与云混合推理的档位划分长上下文所依赖的注意力混合架构厂商自命名基准与第三方基准的可比性开源模型生态的首日支持速度

下一步

学习路径

  1. 先把三项数字分开放:第三方基准(SWE-bench Pro)、厂商自命名基准(QwenSWEBench)、同族前一版对比(WebArena-Verified 48.8 到 64.8),只有第三类和第一类能直接用
  2. 再算显存,而不是看参数量——27B 在什么量化档位下装进 24GB,决定了这条信号对你成不成立
  3. 把 reasoning_effort 三档在自己的任务上各跑一遍,记录首字延迟与稳态吞吐的变化,而不是只记准确率
  4. 读《模型选型与约束匹配》与《旗舰模型发布解读与换代判断》,把「该不该换」和「换得了吗」分成两个问题

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • QwenSWEBench 有没有量过第三方模型?如果没有,那 15.2 分的领先能说明什么?
  • 262K 原生上下文在你的显存预算下还剩多少可用——KV 缓存吃掉的部分算进去了吗?
  • preserve_thinking 默认开启会让上下文更快填满,长任务里它是净收益还是净成本?
  • 线性注意力占 48 层,在需要精确长距离检索的任务上会不会先掉链子?有没有针对这一点的评测?

来源参考

量子位

阿里巴巴通义千问大型科技公司2026-08-15
打开原始来源https://www.qbitai.com/2026/08/473669.html