训练与评测实践
本流程用于验证“准备数据 → 微调 → 导出 → 比较效果”能否在当前环境完成。先选用平台已支持的小模型和训练框架,不以少量示例数据的结果判断生产效果。
1. 准备可检查的数据
将训练数据保存到有权限访问的数据集仓库。数据格式必须与所选训练框架匹配;文件后缀相同不代表字段结构相同。以 Alpaca 风格的监督微调记录为例:
[
{"instruction": "将标签转换为小写", "input": "HELLO", "output": "hello"},
{"instruction": "将标签转换为小写", "input": "WORLD", "output": "world"}
]
这两条记录仅用于验证格式。在框架页面配置数据集及字段映射,预览记录,确认输入与期望输出没有错位。测试集应与训练集分开保存,避免用训练样本衡量泛化效果。
2. 固定实验条件
记录基座模型 ID 与 commit、训练数据版本、框架镜像版本、资源规格、 训练方法、学习率、batch size、梯度累积、训练步数与随机种子(框架支持时)。先用少量数据和较少步数验证流程,再扩大训练。
3. 创建实例并启动训练
按 创建微调实例 选择资源和框架。实例就绪后,在 框架页面 配置数据与参数并开始训练。检查日志、损失曲线与检查点输出目录;创建实例本身不会替代这一步。
4. 导出并验证
按 导出模型 合并或保存所需成果。记录是否为 LoRA adapter、是否需要基座权重,以及目标仓库 commit。重新下载或加载一次导出成果,确认配置与权重齐全后再停止实例。
5. 用同一条件比较模型
按 创建评测 添加基座与微调模型的具体版本,使用同一测试数据、评测框架版本和生成参数。自有测试集先按 自定义评测数据集 配置格式。
查看 评测结果 时记录指标名称、单位、样本数量和失败数量。准确率通常越高越好,延迟通常越低越好;不同指标、数据集或参数下的得分不可直接比较。训练损失下降不等于独立测试效果改善。
6. 保存实验记录并释放资源
保存配置、数据与模型版本、评测结果和必要日志。确认无需继续运行后停止实例,按 实例、数据与用量 检查资源状态。不要在成果仅存于容器本地时删除实例。