模型 · 第 2026-08-16

Qwen3.8-27B 的第三方实测:模型很好,出厂默认不好

本站昨天发这条模型时点名它所有对比都由厂商自跑,缺第三方的尺子。这就是那把尺子:同一道题,出厂默认档跑 21 分钟、烧掉 22,276 个思考 token 产出 3,223 token;关掉思考 137 秒完成。视觉定位很强,而真正的门槛是 15–30 token/秒的吞吐。

Simon Willison Blog2026-08-16值得跟踪

基础信息较完整,适合持续跟踪并等待更多验证。

端侧 AI前沿模型多模态

记录

信号正文

本站 08-16 发布 Qwen3.8-27B 时把编辑判断放在尺子上:领先幅度最大的那一项跑在一把以厂商自己命名的基准上,而所有对比都由厂商自跑。这条是第三方拿真机器跑出来的那把尺子——128GB M5 Max MacBook Pro 与一台 NVIDIA DGX Spark,LM Studio 的 17GB Q4_K_M 量化构建,另在 Spark 上直接试过 llama-server

出厂默认档是错的起点

官方文档写明 reasoning_effort 默认 xhigh,而 LM Studio 的 GGUF 保留了这个默认。代价是可测的:

  • 同一道画图题,默认档跑了 21 分钟,用掉 22,276 个思考 token,产出 3,223 token
  • 关掉思考重跑同一题:3,715 token,137 秒。
  • 更极端的一次,提示词只有「画一个圆的 SVG」,模型花了几分钟产出一幅带动画、同心辅助圆和渐变配色的「几何习作」——完全不是被要求的东西

还有一个很实际的坑:LM Studio 默认 8,192 的上下文上限会被思考过程整个吃光,哪怕问题再普通;把上下文加载到 262,144 之后问题消失。

作者的建议直白:忽略那个默认值,先用 low 甚至完全关掉思考跑

这一条正落在本站《交互系统中的延迟权衡》上:速度永远是「在什么条件下的速度」,而这里决定条件的不是硬件,是一个出厂开关。

视觉与工具使用是真的强

拿边界框考视觉模型:给一张照片,要求以 0–1000 的比例返回鹈鹕的 JSON 边界框。返回的两个框与照片吻合得很好。他随后让模型离线写了一个网页工具,把这类 JSON 叠加到图片上渲染——一句提示词,成品可用。

作为智能体也站得住:通过 Pi 接上跑在 Spark 上的模型,在一个真实代码库里问「鉴权是怎么工作的」,模型经过一串推理与工具调用给出了扎实的回答;再让它把会话记录从 JSONL 转成 Markdown,它写出并测试了可用的脚本。

顺带一个有意思的细节:那个网页工具自作主张加了一个示例场景,因为提示词里给的示例 JSON 标签写着 pelicans——它就自己画了两只鹈鹕。

真正的门槛是吞吐

LM Studio 上大约 15–30 token/秒。 作者的原话是这不算糟,但慢到很难让他放弃托管 API 模型。

这个数字值得和本站昨天那条并排看。那条引了一位网友在单张 GH200 上的实测:并发 10 个请求、首批流式 token 在 10 毫秒内返回。两个数都对,但一个是数据中心加速卡,一个是一台高端笔记本——而后者才是「27B 能本地跑」这句话面向的读者。

边界

这是一位开发者的动手记录,不是系统评测:没有对照组、没有重复运行、没有跨模型的统一口径。它的价值在于给出了厂商公告里没有的三件事——默认档的真实代价、消费级硬件上的吞吐量级、以及视觉定位在真实任务里能用。作者本人也写明,接下来值得看的是独立基准怎么说。

为什么是现在

为什么重要

昨天那条信号明确写着所有对比都由厂商自跑、缺第三方复现,这条正是补上的那一半,而且它补的方向出人意料:模型本身站得住,出问题的是出厂默认值。一个默认 xhigh 的推理档在消费级硬件上把 21 分钟花在一道两分钟的题上,还能把 8,192 的上下文整个吃光——这不是模型能力问题,是发布方替你做完的一个错误权衡。

背景

技术背景

测试机为 128GB M5 Max MacBook Pro 与 NVIDIA DGX Spark,模型为 LM Studio 提供的 17GB Q4_K_M 量化构建,另在 Spark 上直接使用 llama-server。reasoning_effort 官方默认 xhigh,LM Studio 的 GGUF 保留该默认;LM Studio 默认 8,192 上下文会被思考过程耗尽,需加载至 262,144。智能体路径通过 Pi 以 OpenAI-responses 接口接入远端 Spark。吞吐量约 15–30 token/秒。

按你的水平解读

让 AI 按你的水平解读这个信号

选择你的经验水平,AI 会现场生成一份为这个水平定制的解读。

关注人群

谁该关注

打算在笔记本或单机上跑 27B 这一档模型、需要知道真实吞吐而不是数据中心数字的开发者在评估本地模型能否替代托管 API 的团队——15–30 token/秒是那道分界线的具体形态要把视觉模型接进标注或界面理解流程、关心边界框可用性的工程团队负责给团队定默认参数的人:这条是「默认值也是一次权衡」最贵的一次实例
可能影响的领域
本地模型的真实吞吐与托管 API 的分界线推理深度默认值对成本与延迟的影响视觉边界框在真实标注流程中的可用性厂商自测基准与第三方动手实测的差距

下一步

学习路径

  1. 先把 21 分钟对 137 秒这组数字记住:同一道题、同一个模型,差别只在一个默认开关
  2. 拿到任何带推理档位的模型,第一件事是查它的默认值,并在最低档跑一遍作为基线
  3. 算上下文预算时把思考过程算进去——8,192 被吃光这件事不是极端案例,是默认配置下的常态
  4. 读《交互系统中的延迟权衡》,把首字延迟、稳态吞吐与总时长三个数分开记,再决定本地还是托管

怎么学起

让 AI 生成一条学习路径

基于本页的相关知识和相关技能,AI 会现场生成一条从基础到应用的学习路径。

关系网络

在技术网络中的位置

当前技术与相邻技术、技能和背景知识的连接,点击节点可继续探索。

技术对比

对比另一项技术

选择另一项已发布技术,让 AI 现场生成一份相似点、差异点和适用场景的对比。

延伸思考

后续问题

  • 你的模型服务里,推理深度的默认值是谁定的?有没有人量过它在你的任务上的代价?
  • 15–30 token/秒在你的使用场景里是可接受还是不可接受?这个答案决定了本地部署的意义。
  • 厂商公告里的性能数字跑在什么硬件上?把它换算到你实际拥有的机器还剩多少?
  • 视觉边界框好用,但这条没有给出失败率——在你的图片分布上它错多少?

来源参考

Simon Willison Blog

Simon Willison开源社区2026-08-16
打开原始来源https://simonwillison.net/2026/Aug/16/qwen-38-27b/