大多數微調專案在訓練開始前就已失敗
GPU 帳單並非企業微調中昂貴的部分。一個 7B 參數模型在單張 A100 上微調的運算成本為 $100–$400 ;一個 70B 模型的成本為 $4,000–$9,750 每次訓練執行。真正扼殺專案的是訓練迴圈周邊的一切:策劃數千筆特定領域範例、防止模型遺忘既有知識、驗證安全對齊在訓練後仍然存續、為生產環境部署進行量化,以及建立能捕捉漂移的監控管線。
Gartner 預測 到 2027 年,企業使用小型、特定任務 AI 模型的頻率將是通用型 LLM 的三倍。這一轉變已在進行中: 68% 的企業 在 2024 年微調過模型後,回報任務準確度最高提升達 3 倍。但筆記本實驗與生產部署之間的落差,正是多數專案停滯之處。我們的做法是設計整條完整管線,而不僅是訓練迴圈(此一原則的詳細說明見 我們關於打造超越 API 包裝層之系統工程的研究)。
何時該選擇微調(以及何時不該)
提示工程只需數小時。RAG 需要一到四週。微調需要兩到八週,包括資料集建立、訓練、安全測試與生產環境強化。我們在每一項合作案開始時,都會先評估微調是否真有必要。
在以下情況該微調:
- 模型需要提示工程無法穩定產生的新行為或輸出格式;
- 您的領域具有通用模型處理起來不一致的專門推理模式;
- 您需要在規模化下具成本效益的推論——經微調的 7B 模型以每百萬 token $0.20 的成本,取代每百萬 token $2 的 70B 模型;
- 您正在建構工具呼叫可靠性至關重要的 agentic 系統——在基準測試中,經微調的 SLM 將工具呼叫成功率從 10% 提升至 79%(見 一套此類 agentic 排程系統的實際運作示範)。
在以下情況不該微調:
- 問題屬於知識檢索(請用 RAG);
- 每項任務的資料集少於 1,000 筆範例;
- 提示工程已能達到可接受的準確度;
- 基礎模型變動的速度快於您的重新訓練週期。
當 RAG 就能解決問題、微調只會浪費預算時,我們的做法是在任何訓練被納入範圍之前就直言相告,而不是兜售您並不需要的專案。這份坦誠已內建於我們界定合作範圍的方式之中。
框架的選擇很重要
2026 年的格局已整合為幾項各有分工的工具,各自解決不同的問題。
| 框架 | 最適用於 | 限制/註記 |
|---|---|---|
| Unsloth | 在單 GPU 環境中最快 | 開源版本無法擴展至一張以上的 GPU;多 GPU FSDP 僅保留給 Pro 方案 |
| Axolotl | 多 GPU 訓練的生產環境標準 | 在 A100 與 H100 叢集間以 YAML 驅動的可重現性 |
| Hugging Face TRL | 當訓練目標最為關鍵時 | DPO、GRPO、PPO,或任何基於 RL 的對齊工作 |
| LLaMA-Factory | 透過網頁介面進行首次微調 | 易於上手,但多數團隊很快就會超出其能力範圍 |
| TorchTune (Meta) | PyTorch 原生整合 | 適用於 Meta 模型生態系 |
我們會根據您的訓練規模、模型架構與目標來選擇。多數生產部署會使用不只一種:Axolotl 用於監督式微調、TRL 用於偏好優化,Unsloth 用於快速原型製作。
天真的微調無法保住安全對齊
EMNLP 2024 的研究證明,在新的事實知識上微調 LLM 會增加幻覺傾向。另外,來自普林斯頓、史丹佛、維吉尼亞理工與 IBM 的研究人員指出,標準微調會使模型得以完全繞過安全訓練。此後 ICLR 2026 的研究顯示,謹慎的超參數調校可緩解這些風險,但框架的預設配置在出廠時並不帶有任何防護措施。
其機制為:頂層過於激進的參數更新會覆寫掉負責安全的特徵。LoRA 的秩(rank)選擇至關重要——在注意力層上使用較高秩的適配器可能會擾亂拒答迴路,而安全的配置取決於特定的模型架構與任務資料。
我們的做法是實作能保全安全性的管線(其依據為 我們關於潛在空間 AI 安全治理的研究):
- 選擇性 LoRA 以保護關鍵迴路;
- 在每個檢查點使用保留的安全基準測試;
- 依據在任務表現與能力保全之間取得平衡的綜合指標進行早期停止;
- 在整個訓練過程中持續監控對齊退化。
資料策劃才是真正的瓶頸
GPU 時數只是一個項目。資料策劃才是整個專案:
- 讓領域專家(SME)標註 5,000–50,000 筆高品質範例;
- 以標註者間一致性指標來解決標註上的分歧;
- 執行 MinHash/LSH 去重;
- 對照評估集進行汙染檢查;
- 以資料表(datasheet)記錄來源出處。
RLAIF(以 GPT-4 作為標註者)可降低偏好資料的成本,但會引入教師模型偏差。透過師生蒸餾產生的合成資料可用於引導訓練集,不過其品質受限於教師模型的能力上限。
一項合作案的範圍涵蓋資料管線設計、標註工作流程、品質驗證,以及受監管產業的文件:FDA 軟體驗證、金融模型驗證報告,以及符合歐盟《AI 法案》第 11(1) 條要求、附有模型卡的技術文件。
從訓練到生產
量化
以 FP16 進行微調、合併適配器,然後再量化。搭配 Marlin 核心的 AWQ INT4 為 vLLM 服務提供最佳的吞吐量與品質比(741 tok/s)。GPTQ 可與 TensorRT-LLM 及 TGI 整合。GGUF 則是 llama.cpp 與 Ollama 的原生格式。我們會依您的服務堆疊來搭配對應的量化方式。
供應商方案 vs 開源
OpenAI 微調 GPT-4.1 的收費約為每百萬 token $3。Mistral 經微調的 Small 3.1 以每百萬 token $0.20 的成本,在狹窄任務上可媲美其每百萬 token $2 的 Large 3。Anthropic 並未提供公開的微調服務。當資料治理允許使用第三方基礎設施時,供應商 API 適合用於快速迭代。
當資料必須留在您自己的基礎設施上、或法規要求如此時,採用自行代管訓練的開源模型(Llama 3、Mistral、Qwen)才是正確選擇。多數企業兩者並用。
監控與重新訓練
生產環境中的模型會漂移。我們的做法是建立管線,追蹤預測品質、偵測資料漂移與概念漂移,並在跨越門檻時觸發重新訓練。MLflow 或 Weights and Biases 負責實驗追蹤,模型登錄庫則提供從訓練資料到已部署產物的完整譜系。
訓練後對齊:超越 SFT
2026 年的生產環境標準是一條模組化管線:SFT 用於指令遵循、DPO 或 SimPO 用於偏好對齊,GRPO 用於推理。
DPO 藉由消除獎勵模型,取代了 RLHF PPO。SimPO 移除了參考模型,同時在 AlpacaEval 2 上以 6.4 分的優勢勝過 DPO。GRPO(源自 DeepSeek R1)利用可驗證的獎勵,透過純 RL 來訓練推理能力(此一技術見 我們關於圖強化學習的研究),並帶來湧現的自我反思與驗證能力。我們使用 TRL 來實作這些方法——這個框架能把 RL 訓練動態處理得恰到好處。
我們交付的成果
每一項合作案的範圍都以產出一套可部署的系統為目標:
- 附有完整模型卡的微調模型;
- 以可重現程式碼呈現、並附實驗追蹤的訓練管線;
- 一套評估套件,在準確度、延遲、穩健性與校準等面向上,對照基礎模型與其他替代方案進行基準測試;
- 附有最佳化服務配置的量化部署產物;
- 具備漂移偵測與重新訓練觸發機制的監控儀表板;
- 針對受監管產業,提供特定產業的驗證文件(歐盟《AI 法案》、FDA、金融模型驗證)。
這項合作案也會產出一份誠實的評估:微調是否為正確的做法、模型做不到哪些事,以及效能天花板落在何處。事先記錄清楚的限制,比樂觀的預測能省下更多錢。
模型開發與微調
用於物料回收與黑色塑膠分選的 AI | Veriprajna
碳黑顏料會吸收近紅外光。您的光學分選機漏掉的每一個黑色 PP 托盤、PE 容器與 ABS 外殼都會進入殘餘物,最終被掩埋。我們打造能夠回收這些物料的 MWIR 感測與邊緣 AI 層。
航空公司機組排班 AI:在傳統求解器失效時依然有效的 IROPS 復原方案 | Veriprajna
為中型航空公司打造的 AI 機組排班與 IROPS 復原方案。以 ML 強化您的 Jeppesen 或 IBS 系統,處理連鎖式中斷、機組追蹤盲點與 DOT 退款風險。
藥廠與生技業的生物安全 AI 防護 | Veriprajna
2022 年,Collaborations Pharmaceuticals 將其商用的全新藥物探索模型獎勵函數反轉後運行。不到六小時,它便生成了 40,000 種候選分子,其中包含 VX 的類似物。那就是 MegaSyn——一個 2019 年代的 LSTM,在一台工作站上運行。
Explore Solution →常見問題解答
在我們的領域資料上微調 7B 與 70B 模型的成本各是多少?
7B 模型在 A100 基礎設施上,每次訓練迭代的 GPU 運算成本約為 $100-$400,而整體專案成本(包括資料策劃、評估與部署)小規模約在 $500-$2,000,生產級部署則在 $5,000-$15,000。70B 模型需要 800-1,500 GPU 時數,每次執行成本為 $4,000-$9,750,生產專案通常落在 $10,000-$50,000 的範圍。GPU 帳單很少是最大的支出項目。資料策劃、SME 標註時間、安全驗證與法規文件的成本,往往是運算成本的 2-5 倍。我們是依據您實際的任務複雜度與資料就緒程度來界定範圍,而非僅依模型大小。
我們應該微調、使用 RAG,還是提示工程?
先從能解決問題的最便宜方法開始。提示工程只需數小時,成本幾乎為零。RAG 需要 1-4 週,當模型需要存取其未曾訓練過的最新或專有知識時,它是正確的選擇。微調需要 2-8 週,當模型需要學習提示工程無法穩定產生的新行為、輸出格式或特定領域推理時,才有其合理性。2026 年的生產環境標準是混合式的:RAG 提供最新事實、微調形塑模型行為,而提示工程則控制輸出品質。我們在每項合作案開始時,都會先測試較簡單的方法是否已能解決問題,再決定是否建議微調。
我們該使用哪個微調框架:Axolotl、Unsloth 還是 TRL?
每一種都解決不同的問題。Unsloth 在單 GPU 環境中最快,很適合原型製作,但多 GPU FSDP 僅限於其商業版 Pro 方案。Axolotl 是多 GPU 訓練的生產環境標準,具備以 YAML 驅動的可重現性。當訓練目標最為關鍵時,尤其是針對 DPO、GRPO、PPO 或任何強化學習對齊工作,就會使用 TRL。多數生產部署會使用不只一種:Axolotl 用於監督式微調、TRL 用於偏好優化,Unsloth 用於快速實驗。我們會根據您的訓練規模、模型架構與目標來選擇。
我們如何在微調過程中防止災難性遺忘與安全性退化?
標準的微調配置在出廠時並不帶有針對這兩個問題的防護。EMNLP 2024 的研究顯示,在新的事實知識上微調會增加幻覺傾向,另有研究證明天真的微調可能會完全停用安全拒答行為。我們實作能保全安全性的訓練管線:選擇性 LoRA 以保護關鍵的模型迴路、依各模型架構調校的 LoRA 秩校準、在每個訓練檢查點使用保留的安全基準測試、依據在任務表現與能力保全之間取得平衡的綜合指標進行早期停止,以及以縮放律為依據、將安全關鍵層的參數擾動降至最低的學習率排程。
有效微調一個 LLM 所需的最小資料集規模是多少?
每項任務 1,000 筆高品質範例,是使用 LoRA 進行監督式微調的實務最小值。低於此門檻,過度擬合就會佔上風,此時採用少樣本提示或 RAG 會更好。品質比數量更重要:2,000 筆經悉心策劃、標註者間一致性高的範例,表現勝過 20,000 筆充滿雜訊的範例。至於偏好優化(DPO/SimPO),您至少需要 5,000-10,000 組偏好配對。對於採用可驗證獎勵的強化學習(GRPO),需求則從標註資料轉移到一個可靠的驗證器函式。我們會評估您既有的資料資產,並設計標註管線以達到您任務所需的品質門檻。
我們如何微調模型,以在 agentic 工作流程中達到可靠的工具呼叫?
開箱即用的模型經常會虛構工具參數、選錯函式,或在多步驟序列上失敗。在結構化的工具呼叫資料集上微調,已在基準測試中將成功率從 10% 提升至 79%,且經微調的模型在未見過的情境上,工具呼叫獎勵較基礎模型高出 57%。其做法包括:策劃帶有正確函式簽章、參數型別與多步驟鏈的工具呼叫訓練資料,然後先以 SFT 微調,再以執行回饋作為獎勵訊號進行強化學習。我們會建立訓練資料管線、訓練模型,並在部署前對照您實際的 API 介面進行驗證。
LoRA、QLoRA 與全參數微調:我們的使用情境該選哪一種?
全參數微調會更新每一個參數,能提供最高的上限,但對於 7B 以上的任何模型都需要 8 張以上的 GPU。LoRA 會凍結基礎模型並訓練小型的適配器矩陣,在 64-128 的生產級秩設定下,將可訓練參數減少 90% 以上,而品質損失極小。QLoRA 再為凍結的基礎模型加上 4 位元量化,將 VRAM 減少 33%,但訓練時間增加 39%。對多數企業使用情境而言,秩 64-128 的 LoRA 是正確的預設值。GPU 記憶體確實吃緊時採用 QLoRA。唯有當您具備運算預算、有足以支撐的資料集規模(50,000 筆以上範例),且該任務確實能因更新所有參數而受益時,才使用全參數微調。
微調的 AI 模型須符合歐盟《AI 法案》的哪些合規要求?
若您的微調所使用的運算量超過原始模型訓練運算量的三分之一(若原始運算量未知,則為 10^23 FLOPs 的三分之一),歐盟《AI 法案》就會將您視為新的 GPAI 供應商,並課予完整的合規義務:技術文件、模型卡、受著作權保護素材的摘要,以及風險評估。針對高風險 AI 系統的全面執法將於 2026 年 8 月 2 日開始,罰款最高可達 3,500 萬歐元或全球年營業額的 7%。統一的技術標準(CEN/CENELEC JTC 21)仍在最終確定中,目標為 2026 年第四季。我們會產出符合第 11(1) 條與附件四要求的模型卡與技術文件,其設計在現行框架下站得住腳,並可因應最終標準進行調整。
我們該微調一個開源模型,還是使用供應商的微調 API?
當資料治理允許將訓練資料傳送至第三方基礎設施時,供應商 API(OpenAI 微調 GPT-4.1 約每百萬 token $3、Google Vertex 用於 Gemini、Mistral 的 Small 3.1 為每百萬 token $0.20)適合用於快速迭代。當資料必須留在您自己的基礎設施上、您需要對訓練動態擁有完全控制、或法規要求如此時,採用自行代管訓練的開源模型(Llama 3、Mistral、Qwen)才是正確選擇。2026 年多數企業部署兩者並用:供應商 API 用於原型製作與建立基準,開源則用於資料主權或成本最佳化至關重要的生產環境。我們會依據您的限制,而非平台忠誠度,協助您做出這項決策。
我們如何評估微調後的模型是否真的比基礎模型更好?
在保留測試集上的單純準確度是必要的,但並不充分。我們會建立評估套件,衡量:帶有統計顯著性檢定的任務專屬表現、使用取自基礎模型能力集的保留基準來衡量的一般能力保全(藉此捕捉災難性遺忘)、使用標準化安全基準的安全對齊保留度、在生產負載下的延遲與吞吐量、校準品質(模型是否清楚自己不知道什麼),以及跨相關子群體分項的表現,以捕捉訓練資料所引入的偏差。這套評估套件會以可重現程式碼隨模型一併交付,而非一次性的報告。
自信打造您的 AI。
與一支在打造新世代企業級 AI 方面擁有深厚經驗的團隊攜手合作。讓我們協助您設計、建置並部署值得信賴的 AI 策略。
Veriprajna 深度科技顧問公司 專精於為醫療、金融及法規監管領域打造攸關安全的 AI 系統。我們的架構均依循既定規範進行驗證,並備有完整的合規文件。