大多数微调项目在训练开始前就已失败
GPU 账单并不是企业微调中昂贵的部分。一个 70 亿参数模型在单张 A100 上微调需要 $100–$400 的算力;一个 700 亿参数模型的成本为 $4,000–$9,750 ,每次训练运行。真正拖垮项目的,是训练循环之外的一切:整理数千条领域专属样本、防止模型遗忘已掌握的知识、验证安全对齐在训练后依然完好、为生产环境部署进行量化,以及构建能捕捉漂移的监控管线。
Gartner 预测, 到 2027 年,企业使用小型、任务专属 AI 模型的频率将达到通用 LLM 的三倍。这一转变已经开始: 68% 的企业 在 2024 年微调了模型,其报告任务准确率最高提升至 3 倍。但从 notebook 实验到生产部署之间的鸿沟,正是大多数项目停滞之处。我们的做法是工程化整条管线,而不仅仅是训练循环(这一方法论详见 我们关于构建超越 API 封装的工程系统的研究)。
何时该选择微调(何时不该)
提示工程需要数小时。RAG 需要一到四周。微调需要两到八周,包括数据集构建、训练、安全测试和生产加固。我们在每次合作开始时,都会评估微调是否真正必要。
适合微调的情形:
- 模型需要提示工程无法可靠产生的新行为或输出格式;
- 你的领域存在通用模型处理不稳定的专业推理模式;
- 你需要在规模化下实现高性价比推理——一个微调后的 70 亿参数模型($0.20/百万 token)可替代一个 700 亿参数模型($2/百万);
- 你正在构建工具调用可靠性至关重要的智能体系统——在基准测试中,微调后的 SLM 将工具调用成功率从 10% 提升到 79%(参见 一个此类智能体调度系统的可用演示)。
不适合微调的情形:
- 问题属于知识检索(使用 RAG);
- 每个任务的数据集样本少于 1,000 条;
- 提示工程已能达到可接受的准确率;
- 基础模型的更新速度快于你的再训练节奏。
当 RAG 已能解决问题、微调只会浪费预算时,我们会在规划任何训练之前直言相告,而不是向你兜售不需要的项目。这份坦诚已融入我们规划合作的方式中。
框架选择至关重要
2026 年的格局已整合为各具特色的工具,每种工具解决不同的问题。
| 框架 | 最适用于 | 约束 / 备注 |
|---|---|---|
| Unsloth | 在单 GPU 配置上最快 | 开源版本无法扩展到多张 GPU;多 GPU FSDP 仅限 Pro 版本 |
| Axolotl | 多 GPU 训练的生产标准 | 在 A100 和 H100 集群上实现 YAML 驱动的可复现性 |
| Hugging Face TRL | 当训练目标最为关键时 | DPO、GRPO、PPO 或任何基于 RL 的对齐工作 |
| LLaMA-Factory | 通过 Web UI 进行首次微调 | 易于上手,但大多数团队很快就会超出其能力范围 |
| TorchTune (Meta) | PyTorch 原生集成 | 适用于 Meta 模型生态 |
我们会根据你的训练规模、模型架构和目标进行选择。大多数生产部署会同时使用多种:Axolotl 用于监督微调,TRL 用于偏好优化,Unsloth 用于快速原型开发。
安全对齐无法在朴素微调后存续
EMNLP 2024 的研究表明,在新的事实性知识上微调 LLM 会增加幻觉倾向。另有来自普林斯顿、斯坦福、弗吉尼亚理工和 IBM 的研究者表明,标准微调会使模型完全绕过安全训练。此后,ICLR 2026 的研究显示,谨慎的超参数调优可以缓解这些风险,但框架的默认配置在出厂时并不带任何防护。
其机制在于:顶层的激进参数更新会覆盖负责安全的特征。LoRA 秩的选择至关重要——在注意力层上使用更高秩的适配器可能破坏拒绝回路的稳定性,而安全的配置取决于具体的模型架构和任务数据。
我们的做法是实施保护安全的管线(参考 我们关于潜空间 AI 安全治理的研究):
- 选择性 LoRA,保护关键回路;
- 在每个检查点使用留出的安全基准;
- 基于在任务性能与能力保留之间取得平衡的综合指标进行早停;
- 在整个训练过程中持续监控对齐退化。
数据整理才是真正的瓶颈
GPU 时数只是一个账目项。数据整理才是项目本身:
- 让领域专家(SME)标注 5,000–50,000 条高质量样本;
- 用标注者间一致性指标解决标注分歧;
- 运行 MinHash/LSH 去重;
- 针对评估集进行污染检查;
- 用数据说明表(datasheet)记录数据来源。
RLAIF(以 GPT-4 作为标注者)可降低偏好数据的成本,但会引入教师模型偏差。通过师生蒸馏生成的合成数据可以自举训练集,但其质量受限于教师模型的能力上限。
一次合作的范围涵盖数据管线设计、标注工作流、质量验证,以及受监管行业的文档:FDA 软件验证、金融模型验证报告,以及符合《欧盟 AI 法案》第 11(1) 条要求、附带模型卡的技术文档。
从训练到生产
量化
以 FP16 微调,合并适配器,然后进行量化。搭配 Marlin 内核的 AWQ INT4 为 vLLM 服务提供了最佳的吞吐量与质量比(741 tok/s)。GPTQ 可与 TensorRT-LLM 和 TGI 集成。GGUF 是 llama.cpp 和 Ollama 的原生格式。我们会使量化方案与你的服务栈相匹配。
厂商方案 vs 开源方案
OpenAI 微调 GPT-4.1 的收费约为 $3/百万 token。Mistral 微调后的 Small 3.1($0.20/百万)在狭窄任务上可媲美其 Large 3($2/百万)。Anthropic 不提供公开的微调服务。当数据治理允许使用第三方基础设施时,厂商 API 适合快速迭代。
当数据必须留在你自己的基础设施上、或监管要求如此时,采用自托管训练的开源模型(Llama 3、Mistral、Qwen)才是正确之选。大多数企业两者兼用。
监控与再训练
生产模型会发生漂移。我们的做法是构建管线,跟踪预测质量、检测数据漂移和概念漂移,并在超过阈值时触发再训练。MLflow 或 Weights and Biases 负责实验跟踪,模型注册表则提供从训练数据到部署产物的完整血缘。
训练后对齐:超越 SFT
2026 年的生产标准是一条模块化管线:SFT 用于指令遵循,DPO 或 SimPO 用于偏好对齐,GRPO 用于推理。
DPO 通过取消奖励模型取代了 RLHF PPO。SimPO 去除了参考模型,同时在 AlpacaEval 2 上以 6.4 分优于 DPO。GRPO(源自 DeepSeek R1)使用可验证的奖励,通过纯 RL 训练推理能力(这一技术详见 我们关于图强化学习的研究),并伴随涌现的自我反思与验证。我们使用 TRL 来实现这些方法——正是这个框架能正确把握 RL 训练动态。
我们交付什么
每次合作的范围都以产出一个可部署的系统为目标:
- 附带完整模型卡的微调模型;
- 以可复现代码形式呈现、带实验跟踪的训练管线;
- 一套评估套件,在准确率、延迟、鲁棒性和校准方面对照基础模型及其他方案进行基准测试;
- 带优化服务配置的量化部署产物;
- 带漂移检测和再训练触发器的监控仪表板;
- 对于受监管行业,提供行业专属的验证文档(欧盟 AI 法案、FDA、金融模型验证)。
合作还会产出一份诚实的评估:微调是否是正确的方法、模型无法做到什么,以及性能上限在哪里。事先书面记录的局限性,比乐观的预测更能省钱。
模型开发与微调
面向材料回收与黑色塑料分选的 AI | Veriprajna
炭黑颜料会吸收近红外光。光学分选机漏掉的每一个黑色 PP 托盘、PE 容器和 ABS 外壳都会进入残渣,最终被填埋。我们构建 MWIR 传感与边缘 AI 层,将这些材料重新回收。
航空机组排班 AI:在传统求解器失效时仍然奏效的不正常运行(IROPS)恢复 | Veriprajna
面向中型航空公司的 AI 机组排班与不正常运行(IROPS)恢复方案。在 Jeppesen 或 IBS 之上叠加机器学习,应对连锁中断、机组追踪盲区与 DOT 退款敞口。
面向药企与生物技术的生物安全 AI 防护 | Veriprajna
2022 年,Collaborations Pharmaceuticals 将其商用从头(de novo)药物发现模型的奖励函数翻转后运行。不到六小时,它就生成了 40,000 个候选分子,其中包括 VX 的类似物。那就是 MegaSyn——一个 2019 年时代的 LSTM 模型,在单台工作站上运行。
Explore Solution →常见问题解答
在我们的领域数据上微调 70 亿参数模型与 700 亿参数模型分别需要多少成本?
在 A100 基础设施上,70 亿参数模型每次训练迭代的 GPU 算力成本为 $100-$400,项目总成本(含数据整理、评估和部署)在小规模场景下为 $500-$2,000,生产级部署则为 $5,000-$15,000。700 亿参数模型每次运行需要 800-1,500 GPU 时、成本为 $4,000-$9,750,生产项目通常在 $10,000-$50,000 区间。GPU 账单很少是最大的支出项。数据整理、领域专家标注时间、安全验证和合规文档往往比算力成本高出 2-5 倍。我们会根据你实际的任务复杂度和数据就绪程度来规划范围,而不仅仅依据模型规模。
我们应在何时选择微调、何时选择 RAG、何时选择提示工程?
从能解决问题的最低成本方案开始。提示工程只需数小时、几乎不花成本。RAG 需要 1-4 周,当模型需要访问其未曾训练过的最新知识或专有知识时,它是正确之选。微调需要 2-8 周,当模型需要学习提示工程无法可靠产生的新行为、输出格式或领域专属推理时,微调才有理由。2026 年的生产标准是混合式的:RAG 提供最新事实,微调塑造模型行为,提示工程控制输出质量。在推荐微调之前,我们会在每次合作开始时先测试更简单的方案能否解决问题。
我们应使用哪个微调框架:Axolotl、Unsloth 还是 TRL?
每个框架解决不同的问题。Unsloth 在单 GPU 配置上最快、非常适合原型开发,但多 GPU FSDP 仅限其商业 Pro 版本。Axolotl 是多 GPU 训练的生产标准,具备 YAML 驱动的可复现性。当训练目标最为关键时——尤其是 DPO、GRPO、PPO 或任何强化学习对齐工作——你会使用 TRL。大多数生产部署会同时使用多种:Axolotl 用于监督微调,TRL 用于偏好优化,Unsloth 用于快速实验。我们会根据你的训练规模、模型架构和目标进行选择。
我们如何在微调过程中防止灾难性遗忘与安全退化?
标准的微调配置在出厂时对这两个问题都没有任何防护。EMNLP 2024 的研究表明,在新的事实性知识上微调会增加幻觉倾向,另有研究证明,朴素微调可能完全禁用安全拒绝行为。我们实施保护安全的训练管线:保护关键模型回路的选择性 LoRA、针对每种模型架构调校的 LoRA 秩标定、在每个训练检查点使用留出的安全基准、基于在任务性能与能力保留之间取得平衡的综合指标进行早停,以及依据缩放定律设定的学习率调度,以最小化对安全关键层的参数扰动。
有效微调一个 LLM 所需的最小数据集规模是多少?
对于使用 LoRA 的监督微调,每个任务 1,000 条高质量样本是实用的下限。低于该阈值时过拟合会占主导,此时少样本提示或 RAG 更为合适。质量比数量更重要:2,000 条经过精心整理、标注者间一致性高的样本,胜过 20,000 条含噪样本。对于偏好优化(DPO/SimPO),你至少需要 5,000-10,000 对偏好数据。对于带可验证奖励的强化学习(GRPO),需求从标注数据转向可靠的验证器函数。我们会评估你现有的数据资产,并设计标注管线以达到你的任务所需的质量阈值。
我们如何微调模型,以在智能体工作流中实现可靠的工具调用?
开箱即用的模型经常会臆造工具参数、选错函数或在多步序列中失败。在结构化的工具调用数据集上微调,已在基准测试中将成功率从 10% 提升到 79%,且与基础模型相比,微调后的模型在未见场景下的工具调用奖励高出 57%。该方法包括:整理带有正确函数签名、参数类型和多步链条的工具调用训练数据,然后先以 SFT 微调、再以执行反馈作为奖励信号进行强化学习。我们会构建训练数据管线、训练模型,并在部署前针对你实际的 API 接口进行验证。
LoRA、QLoRA 与全量微调:我们的用例应选择哪种方法?
全量微调会更新每一个参数、能达到最高的性能上限,但对于 70 亿参数以上的模型需要 8 张以上 GPU。LoRA 冻结基础模型、只训练小型适配器矩阵,在 64-128 的生产级秩设置下可将可训练参数减少 90% 以上,而质量损失极小。QLoRA 在此基础上对冻结的基础模型加入 4 位量化,将显存占用削减 33%,代价是训练时间增加 39%。对于大多数企业用例,秩 64-128 的 LoRA 是正确的默认选择。当 GPU 内存确实受限时选择 QLoRA。只有当你具备算力预算、有足够规模的数据集(50,000 条以上样本)、且任务确实能从更新全部参数中获益时,才选择全量微调。
《欧盟 AI 法案》对微调后的 AI 模型有哪些合规要求?
如果你的微调所用算力超过原始模型训练算力的三分之一(若原始算力未知,则为 10^23 FLOPs 的三分之一),《欧盟 AI 法案》会将你视为新的通用人工智能(GPAI)提供者,负有完整的合规义务:技术文档、模型卡、受版权保护材料的摘要,以及风险评估。针对高风险 AI 系统的全面执法将于 2026 年 8 月 2 日开始,罚款最高可达 3,500 万欧元或全球年营业额的 7%。协调技术标准(CEN/CENELEC JTC 21)仍在最终制定中,目标为 2026 年第四季度。我们出具符合第 11(1) 条和附件四要求的模型卡与技术文档,其设计既能在现行框架下站得住脚,也能适配最终标准。
我们应微调开源模型,还是使用厂商的微调 API?
当数据治理允许将训练数据发送到第三方基础设施时,厂商 API(OpenAI 训练 GPT-4.1 约 $3/百万 token、Google Vertex 用于 Gemini、Mistral 的 Small 3.1 为 $0.20/百万)适合快速迭代。当数据必须留在你自己的基础设施上、你需要对训练动态拥有完全控制、或监管要求如此时,采用自托管训练的开源模型(Llama 3、Mistral、Qwen)才是正确之选。2026 年大多数企业部署两者兼用:厂商 API 用于原型开发和基线,开源用于对数据主权或成本优化有要求的生产环境。我们会根据你的约束条件(而非平台忠诚度)帮助你做出这一决策。
我们如何评估微调后的模型是否确实优于基础模型?
在留出测试集上的简单准确率是必要但不充分的。我们构建的评估套件会衡量:带统计显著性检验的任务专属性能、使用取自基础模型能力集的留出基准来衡量的通用能力保留(用以捕捉灾难性遗忘)、使用标准化安全基准衡量的安全对齐保持、生产负载下的延迟与吞吐量、校准质量(模型是否知道自己不知道什么),以及按相关子群分解的性能,以捕捉训练数据引入的偏差。该评估套件以可复现代码的形式随模型交付,而非一次性的报告。
满怀信心地构建您的 AI。
与一支在打造新一代企业级 AI 方面拥有深厚经验的团队携手合作。让我们助您设计、构建并部署一套值得信赖的 AI 战略。
Veriprajna 深度科技咨询公司 专注于为医疗健康、金融和监管等领域构建安全攸关的 AI 系统。我们的架构均依据成熟的规范进行验证,并配有完善的合规文档。