工程落地
视觉输入的组织与核验
把截图、图表和文档整理成模型真正读得懂的输入,并用可复现的手段确认它读对了——视觉任务的失败往往是安静的。
这项技能能帮你做什么
Inkling 这类原生处理文本、图像与音频的模型,把「让模型看一眼」从特殊能力变成了默认能力;编码助手靠截图定位问题,浏览器代理靠看页面决定下一步。但「把图丢进去」和「把图组织好再丢进去」,结果差得很远,而这一层几乎没有人系统地讲。这项技能就管两件事:怎么把视觉信息送进模型,以及怎么确认它真的读对了。
输入侧有三个决定成败的动作。第一是分辨率与裁剪:图像会被切成视觉 token,模型看到的是缩放后的版本,界面里的小号文字和细线最先糊掉——截到目标区域,比丢一张整屏截图再让模型自己找更可靠。第二是图文交错与指代:一次给多张图时用编号和文字锚点(「第 2 张图里红框那块」)代替「上图」,模型对图片顺序的记忆远不如人稳。第三是判断什么时候根本不该用原生视觉:表格数值、密集文本、需要逐字准确的内容,先做 OCR 或者直接取结构化源数据,比让模型「看」更便宜也更准;原生视觉的强项在布局、空间关系和难以结构化的现场场景。
代价要按 token 估,而不是按「一张图」估——一张高分辨率截图可能吃掉数千 token,同时把首响应延迟顶上去,这两件事会直接进入上下文预算与模型选型的决策。核验则是这项技能真正的分水岭:视觉任务的失败是安静的,模型会用和答对时一模一样的自信语气,描述图里并不存在的按钮、或者把数字读错一位。三种可复现的手段:让模型先复述关键元素(位置、数量、读数)再作答,把错误暴露在中间步骤而不是结论里;准备反事实图——改掉一个数字、移走一个控件——看输出是否跟着变,不变就说明它压根没在看;读数类任务与 OCR 基线逐条比对。
边界要划清楚:这项技能讲的是把视觉信息送进模型并确认它读对了,不负责设计整套评测体系(那是《模型与输出评估》要回答的),不涉及语音的轮次节奏、打断与失败兜底(那是《实时语音交互设计》),也不讲怎么训练或微调视觉模型(那是《模型微调与后训练定制》)。掌握的标志:接到「让模型看图做判断」的需求时,能先说清哪部分走原生视觉、哪部分该退回 OCR 或结构化数据;能给出这次输入的 token 量级与延迟影响;并且在上线前就备好了一组反事实图,而不是等用户报错才发现模型一直在猜。
关系网络
在关系网络中的位置
这项技能相邻的技术信号与背景概念,点击节点可继续探索。
用已发布信号练习
这项技能有助于评估的技术信号
背景概念