机器学习
合成数据与数据配方
为什么新一代模型的能力越来越取决于「数据是怎么配出来的」,以及合成数据在其中扮演的角色与风险。
前沿模型AI 智能体
这个概念是什么意思
预训练语料的自然供给接近见顶之后,前沿模型的差异越来越来自数据配方:用什么比例混合网页、代码、数学与对话数据,哪些环节用模型生成的合成数据补足。智能体能力尤其如此——工具调用失败的轨迹、多步推理过程、检索与用户模拟这类数据在自然语料中几乎不存在,只能靠工程化合成(NVIDIA 的 Nemotron 开放数据集就是这一主张的公开落地)。理解这一层有两个实际意义:评估一个新模型时,数据配方的公开程度比参数量更能说明它的能力边界与复现性;使用合成数据时要警惕分布收窄与自我强化——用模型生成的数据训练模型,错误模式会被放大,所以配方里通常要保留真实数据锚点和独立的评估集。
关系网络
在关系网络中的位置
这个概念相邻的技术信号与相关技能,点击节点可继续探索。
可解释
这个概念能解释的技术信号
搭配技能