2 模型预训练、微调、强化学习的格式
1 训练预料的大小训练阶段数据量级数据来源用途预训练100亿 tokens通用语料行业语料构建基础语言能力继续预训练(CPT)10亿 tokens行业专业文档注入领域知识监督微调(SFT)1万-10万条指令-响应对任务对齐偏好优化(DPO)5千-5万条偏好对比数据价值观对齐模型规模预训练数据SFT数据DPO数据7B以下100亿 tokens5千-1万条2千-5千条7B-13B500亿 tokens1万-5万条5千-1万条13B以上1000亿 tokens5万-10万条1万-5万条工具用途链接LLaMA Factory微调数据预处理GitHub开源Data-Juicer数据清洗处理阿里开源Dataprep数据准备流水线Google开源Label Studio数据标注平台开源/企业版2 数据格式详解2.1 预训练数据格式C4 数据集的主要格式特点文件格式.json.gz压缩的 JSON Lines 文件每行一个 JSON 对象对应一个文本样本适用场景基础模型训练、继续预训练# 格式JSONL (JSON Lines)一行一个JSON对象{text: 这是第一段预训练文本内容...} {text: 这是第二段预训练文本内容...}{text: 这是第三段预训练文本内容...}要求✅ 纯文本无特殊标记✅ 每行独立JSON对象✅ UTF-8编码✅ 单条文本建议 512-4096 tokens2.2 指令微调(SFT)数据格式2.2.1 Alpaca 格式单轮对话适用场景问答、文本生成、分类等单轮任务{instruction: 请总结以下会议记录的核心内容, input: 2026年3月10日产品例会1.新版本上线时间确定为3月25日 2.用户反馈问题优先级调整 3.下季度OKR目标讨论..., output: 会议核心内容1.新版本3月25日上线 2.调整用户反馈问题优先级 3.讨论下季度OKR目标}{instruction: 根据客户需求生成产品推荐方案, input: 客户行业制造业规模500人预算50万需求生产管理系统, output: 推荐方案针对500人规模的制造企业建议选择XX生产管理系统包含生产计划、质量管理、设备维护模块预估实施周期3个月...}{instruction: 将以下技术文档翻译成英文, input: 系统支持高并发访问采用负载均衡技术确保服务稳定性。, output: The system supports high-concurrency access and uses load balancing technology to ensure service stability.}2.2.2 ShareGPT 格式多轮对话适用场景客服对话、多轮问答、助手类应用{ conversations: [ {role: user, content: 你好我想查询订单状态},{role: assistant, content: 您好请提供您的订单号我帮您查询。},{role: user, content: 订单号是 ORD20260314001},{role: assistant, content: 已为您查询到订单 ORD20260314001当前状态已发货预计3月16日送达。} ] }2.2.3 通用对话格式推荐适用场景大多数微调框架支持LLaMA Factory、Axolotl等{ id: sample_001,messages: [ {role: system, content: 你是企业知识库助手}, {role: user, content: 公司年假政策是什么}, {role: assistant, content: 根据公司规定员工年假政策如下1.入职满1年享有5天年假 2.满3年享有10天 3.满5年享有15天...} ],metadata: { source: hr_policy_doc, category: 人力资源, difficulty: easy } }2.3 偏好优化(DPO)数据格式适用场景RLHF替代方案价值观对齐{ prompt: 如何优化公司成本控制, chosen: 建议从三个方面优化1.采购成本建立供应商评估体系定期比价 2.运营成本推行数字化办公减少纸质流程 3.人力成本优化组织结构提升人效..., rejected: 可以裁员降薪来降低成本。, metadata: { reason: chosen回答更专业且符合企业价值观 } }