Qwen3.8-27B 开源:消费级显卡跑得动,尺子却是自己命名的
270 亿参数、原生多模态、262K 上下文可外推到 100 万,Apache 2.0,量化后一张 24GB 消费级显卡装得下——这一代 Qwen 把「本地跑得动的智能体」这条线又往前推了一格。榜单确实好看,但领先幅度最大的那一项跑在一把以厂商自己命名的基准上,而所有对比都由厂商自己完成。
基础信息较完整,适合持续跟踪并等待更多验证。
记录
信号正文
2026-08-14,阿里以 Apache 2.0 协议开源 Qwen3.8-27B。27B 是社区呼声最高的尺寸,原因很实际:量化之后,24GB 显存的 RTX 3090 / 4090 这类显卡能整卡装下,而上下文没有跟着缩水——原生 262K token,通过 YaRN 可外推至 100 万。
值得记的是架构,不是尺寸
模型共 64 层,其中 48 层用 Gated DeltaNet 线性注意力,16 层保留完整注意力,大致按「三层线性 + 一层完整」的节奏循环。线性注意力压住长序列的计算与缓存开销,完整注意力隔几层做一次更充分的信息交互——262K 原生上下文是这个配比换来的,不是堆出来的。这个骨干与 Qwen3.5 / 3.6 同源,ms-swift 的发布说明也是这么描述的。
两个面向长任务的开关同样值得记:
reasoning_effort分 xhigh / medium / low 三档,复杂代码与长程智能体任务拉高,简单问答降下来换速度和成本;Thinking 也可以整个关掉。preserve_thinking默认开启,前几轮「怎么想的」会留在后续上下文里。编码智能体连改十几个文件时,可以沿着前面的决策继续走,同时更好地复用 KV 缓存。
补充(2026-08-17):第一份第三方动手实测出来了,而它指向的正是第一条那个默认值。同一道画图题,出厂的 xhigh 默认档跑 21 分钟、烧掉 22,276 个思考 token,关掉思考只要 137 秒;LM Studio 默认 8,192 的上下文会被思考过程整个吃光。先用 low 或直接关掉思考跑,再决定要不要拉高。详见延伸阅读那条。
生态当天就跟上了
- Ollama v0.32.12(08-14)加入
qwen3.8:27b,并为 Apple Silicon 单独提供了qwen3.8:27b-mlx构建;次日的 v0.32.13 补上开发者指令支持。 - ms-swift v4.5.0(08-14)同日适配训练与后训练侧。
- 官方侧接上了 Transformers、vLLM、SGLang 与 TokenSpeed,Hugging Face 上量化版本入口同时开放。
首日可服务这件事本身已经不新鲜了——从 Kimi K3 到 Muse Glimmer,本站记过好几次;值得注意的是这次连 Apple Silicon 的专用构建都在同一天。
榜单很好看,但尺子是谁的
厂商公布的对比里,Qwen3.8-27B 在多项评测上超过 Claude Opus 4.6 Max:
- SWE-bench Pro:领先 8.3 分
- QwenSWEBench:领先 15.2 分
- CoWorkBench:70.7 对 68.2
- OSWorld-Verified(电脑操作):84.3 对 72.7
- AndroidWorld(手机操作):81.9 对 62.0
领先幅度最大的那一项,跑在一把名字里带着厂商自己的基准上。 本站《模型与输出评估》里那条判据在这里几乎是逐字适用的:一个数字能不能横比,先问这把尺子有没有量过别人。QwenSWEBench 领先 15.2 分,而第三方的 SWE-bench Pro 领先 8.3 分——两个数差了将近一倍,方向一致但幅度不一致,而且所有对比都是厂商自己跑的,不是第三方复现。
浏览器操作 WebArena-Verified 从上一代的 48.8 提升到 64.8,是这批数字里口径最干净的一个:同族前一版,同一项评测。
社区实测是用户报告,不是评测
量子位那篇里引了两条网友实测,值得读但要按用户报告对待:一位把 FP8 版本放在单张 GH200 上并发跑 10 个请求、每个最高输出 16K token、上下文拉到 262K,首批流式 token 基本在 10 毫秒内返回;另一位丢给它一部 1935 年的 11 分钟影片,让它识别 96 个带时间戳的事件并逐字引用画面文字,157 秒完成、时间点误差约 2 秒。没有对照组、没有重复运行,所以它们说明的是「跑得起来」,不是「跑得比谁好」。
一处可核对的口径差
官方称千问已累计开源 460 余个模型、全球下载超 30 亿次、衍生模型数超 30 万个。同一周 Hugging Face 那份生态报告独立数出来的是 Hub 上 151,448 个 Qwen 衍生模型。两个数字差了大约一倍,但并不矛盾——一个统计跨平台(含魔搭),一个只统计 Hub。知道它们口径不同,比记住哪个更大有用。
为什么是现在
为什么重要
本地能跑的那一档模型,长期以来的代价是上下文短、多模态缺失或智能体能力弱。27B 这个尺寸同时给了 262K 原生上下文、原生视觉理解和可调的推理深度,而且是 Apache 2.0——这把「先看看能不能本地跑」从妥协方案变成了默认起点。同一周 Hugging Face 的生态报告给了这件事的宏观背景:小模型拿走 83% 的下载量,而 Qwen 是社区衍生模型最多的基座。
背景
技术背景
64 层骨干中 48 层为 Gated DeltaNet 线性注意力、16 层为完整注意力,按三比一循环,与 Qwen3.5 / 3.6 同源。原生 262K token 上下文,经 YaRN 外推至 100 万。原生多模态,覆盖图片、文档、图表与视频理解。reasoning_effort 提供 xhigh / medium / low 三档并可完全关闭 Thinking;preserve_thinking 默认开启,把前几轮推理保留进后续上下文以复用 KV 缓存。Apache 2.0,量化后可在 24GB 显存整卡装载,推理路径覆盖 Transformers、vLLM、SGLang、TokenSpeed、Ollama(含 MLX 构建)与 ms-swift。
关注人群
谁该关注
下一步
学习路径
- 先把三项数字分开放:第三方基准(SWE-bench Pro)、厂商自命名基准(QwenSWEBench)、同族前一版对比(WebArena-Verified 48.8 到 64.8),只有第三类和第一类能直接用
- 再算显存,而不是看参数量——27B 在什么量化档位下装进 24GB,决定了这条信号对你成不成立
- 把 reasoning_effort 三档在自己的任务上各跑一遍,记录首字延迟与稳态吞吐的变化,而不是只记准确率
- 读《模型选型与约束匹配》与《旗舰模型发布解读与换代判断》,把「该不该换」和「换得了吗」分成两个问题
关系网络
在技术网络中的位置
当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。
延伸思考
后续问题
- QwenSWEBench 有没有量过第三方模型?如果没有,那 15.2 分的领先能说明什么?
- 262K 原生上下文在你的显存预算下还剩多少可用——KV 缓存吃掉的部分算进去了吗?
- preserve_thinking 默认开启会让上下文更快填满,长任务里它是净收益还是净成本?
- 线性注意力占 48 层,在需要精确长距离检索的任务上会不会先掉链子?有没有针对这一点的评测?
来源参考