工程落地

模型微调与后训练定制

在开源权重上做监督微调、偏好对齐与蒸馏,把通用基座改造成领域模型——数据配方与评测把关比训练脚本本身更决定成败。

当前热门学习成本高
前沿模型推理与部署

这项技能能帮你做什么

Inkling 这类开源万亿参数 MoE 的出现,把「定制一个自己的模型」从大厂专利变成普通工程团队的可行选项。后训练(post-training)是一个谱系:监督微调(SFT)教模型领域格式与知识,偏好对齐(DPO / RLHF 一族)教模型「什么样的回答更好」,蒸馏则把大模型的能力压进部署成本可承受的小模型。三者常常组合使用,而不是三选一。

实践的重心在数据而非算法:决定微调上限的是数据配方——各来源数据的配比、清洗与去污染规则、合成数据的生成与筛选策略。NVIDIA Nemotron 的开放数据集展示了工业级配方长什么样,也说明这层 know-how 正在从秘方变成可参照的公共工件。评测必须先行:没有独立于训练集的评测集,微调效果无从谈起。基座是 MoE 时还有额外功课——专家路由与负载均衡在微调中容易被破坏,需要针对性的稳定手段。

判断掌握程度的标志:接到需求时能先回答「这个任务真的需要微调,还是提示工程或检索增强就够了」;训练前评测集已经就位;知道蒸馏后的部署成本如何反过来进入模型选型决策,而不是训练完才发现推理开销不可接受。

关系网络

在关系网络中的位置

这项技能相邻的技术信号与背景概念,点击节点可继续探索。

用已发布信号练习

这项技能有助于评估的技术信号

背景概念

与这项技能搭配的知识