モデル開発とファインチューニング
安全性アライメントを維持したまま本番モデルを納品する、カスタムモデルのトレーニングとパラメータ効率の良いファインチューニング。規制対応の文書一式も含みます。
ほとんどのファインチューニング・プロジェクトは、トレーニング開始前に失敗している
エンタープライズのファインチューニングにおいて、高コストなのはGPU料金ではありません。70億パラメータのモデルは、単一のA100で $100〜$400 の計算コストでファインチューニングでき、700億パラメータのモデルでは1回のトレーニング実行あたり $4,000〜$9,750 かかります。プロジェクトを頓挫させるのは、トレーニングループを取り巻くすべての作業です。すなわち、ドメイン固有の数千件におよぶ事例のキュレーション、モデルが既に習得した知識を忘れないようにすること、安全性アライメントがトレーニングを経ても維持されているかの検証、本番運用のための量子化、そしてドリフトを捉える監視パイプラインの構築です。
Gartnerの予測によれば、 2027年までに、組織は汎用LLMと比べて、小規模でタスク特化型のAIモデルを3倍多く利用するようになります。この移行はすでに始まっています。 68%の企業 が、2024年にモデルをファインチューニングした結果、タスク精度が最大3倍向上したと報告しています。しかし、ノートブック上の実験と本番デプロイメントとの間にあるギャップこそが、ほとんどのプロジェクトが行き詰まる場所です。私たちのアプローチは、トレーニングループだけでなく、パイプライン全体をエンジニアリングすることです(この方針は APIラッパーを超えたシステムのエンジニアリングに関する当社の研究で詳しく述べています)。
ファインチューニングが正しい選択となる場合(と、そうでない場合)
プロンプトエンジニアリングは数時間で済みます。RAGは1〜4週間かかります。ファインチューニングは、データセット作成、トレーニング、安全性テスト、本番向けの堅牢化を含めて2〜8週間かかります。私たちはすべての取り組みを、ファインチューニングが本当に必要かどうかの評価から始めます。
ファインチューニングすべき場合:
- プロンプティングでは確実に生成できない新しい挙動や出力フォーマットがモデルに必要なとき。
- 汎用モデルでは一貫して扱えない、専門的な推論パターンがドメインに存在するとき。
- スケール時にコスト効率の良い推論が必要なとき——$0.20/Mトークンでファインチューニングした70億モデルが、$2/Mの700億モデルを置き換えます。
- ツール呼び出しの信頼性が重要なエージェント型システムを構築しているとき——ファインチューニングされたSLMは、ベンチマークにおいてツール呼び出しの成功率を10%から79%へ改善しました( そうしたエージェント型スケジューリングシステムの一例の実働デモをご覧ください)。
ファインチューニングすべきでない場合:
- 問題が知識検索である(RAGを使うべき)。
- データセットがタスクあたり1,000件未満の事例しかない。
- プロンプトエンジニアリングで既に許容できる精度が達成されている。
- ベースモデルの変化が、再トレーニングの頻度よりも速い。
RAGで問題が解決し、ファインチューニングでは予算を浪費するだけの場合、私たちのアプローチは、トレーニングをスコープする前にそう伝えることであり、必要のないプロジェクトを売り込むことはしません。この誠実さは、私たちが取り組みをスコープする方法そのものに組み込まれています。
フレームワークの選択が重要
2026年の状況は、それぞれ異なる問題を解決する明確なツール群へと集約されています。
| フレームワーク | 最適な用途 | 制約・注意点 |
|---|---|---|
| Unsloth | 単一GPU構成での最速 | オープンソース版は1つのGPUを超えてスケールできない。マルチGPUのFSDPはProティア限定 |
| Axolotl | マルチGPUトレーニングの本番標準 | A100およびH100クラスタ間でのYAML駆動の再現性 |
| Hugging Face TRL | トレーニングの目的が最重要な場合 | DPO、GRPO、PPO、あるいはあらゆるRLベースのアライメント作業 |
| LLaMA-Factory | Web UIによる初めてのファインチューニング | 扱いやすいが、ほとんどのチームはすぐに物足りなくなる |
| TorchTune (Meta) | PyTorchネイティブの統合 | Metaのモデルエコシステム向け |
私たちは、トレーニングの規模、モデルアーキテクチャ、および目的に基づいて選定します。ほとんどの本番デプロイメントでは複数を併用します。すなわち、教師ありファインチューニングにはAxolotl、選好最適化にはTRL、そして迅速なプロトタイピングにはUnslothです。
安全性アライメントは、素朴なファインチューニングでは維持されない
EMNLP 2024の研究は、新しい事実知識でLLMをファインチューニングするとハルシネーションの傾向が増すことを実証しました。これとは別に、Princeton、Stanford、Virginia Tech、およびIBMの研究者らは、標準的なファインチューニングによってモデルが安全性トレーニングを完全に回避できるようになることを示しました。その後、ICLR 2026の研究により、慎重なハイパーパラメータ調整でこれらのリスクが緩和されることが示されましたが、フレームワークのデフォルト設定は保護策のないまま出荷されています。
そのメカニズム:上位層における過度なパラメータ更新が、安全性を担う特徴を上書きしてしまうのです。LoRAのランク選択が重要です——アテンション層における高ランクのアダプタは拒否回路を不安定化させる恐れがあり、安全な設定は特定のモデルアーキテクチャとタスクデータに依存します。
私たちのアプローチは、安全性を保持するパイプラインを実装することです( 潜在空間におけるAI安全性ガバナンスに関する当社の研究に基づいています):
- 重要な回路を保護する選択的LoRA。
- 各チェックポイントでのホールドアウト安全性ベンチマーク。
- タスク性能と能力の保持をバランスさせる複合指標に基づく早期停止。
- トレーニング全体を通じたアライメント劣化の継続的監視。
データキュレーションこそが真のボトルネック
GPU時間は明細の一項目にすぎません。データキュレーションこそがプロジェクトの本体です。
- SMEに5,000〜50,000件の高品質な事例をラベル付けしてもらうこと。
- アノテーター間一致度の指標を用いてアノテーションの不一致を解消すること。
- MinHash/LSHによる重複排除を実行すること。
- 評価セットに対する汚染チェック。
- データシートによる出所の文書化。
RLAIF(GPT-4をラベラーとして使用)は選好データのコストを削減しますが、教師モデルのバイアスを持ち込みます。教師-生徒蒸留による合成データはトレーニングセットのブートストラップに役立ちますが、品質は教師モデルの能力によって上限が定まります。
取り組みは、データパイプラインの設計、アノテーションのワークフロー、品質検証、および規制業界向けの文書化を対象にスコープされます。すなわち、FDAのソフトウェア検証、金融モデル検証レポート、そしてArticle 11(1)の要件を満たすモデルカードを備えたEU AI Actの技術文書です。
トレーニングから本番へ
量子化
FP16でファインチューニングし、アダプタをマージし、その後に量子化します。Marlinカーネルを用いたAWQ INT4は、vLLMサービングにおいて最良のスループット対品質比を実現します(741 tok/s)。GPTQはTensorRT-LLMおよびTGIと統合します。GGUFはllama.cppおよびOllamaにネイティブ対応しています。私たちは量子化をお客様のサービングスタックに合わせて選定します。
ベンダー vs オープンソース
OpenAIはGPT-4.1のファインチューニングに約$3/Mトークンを課金します。Mistralのファインチューニング版Small 3.1は$0.20/Mで、狭いタスクにおいて$2/MのLarge 3に匹敵します。Anthropicは公開のファインチューニングを提供していません。ベンダーAPIは、データガバナンスがサードパーティのインフラを許容する場合、迅速なイテレーションに有効です。
オープンソースモデル(Llama 3、Mistral、Qwen)を自社ホスティングでトレーニングすることは、データが自社インフラ内に留まる必要がある場合や、規制要件がそれを求める場合に適しています。ほとんどの企業は両方を併用します。
監視と再トレーニング
本番モデルはドリフトします。私たちのアプローチは、予測品質を追跡し、データドリフトと概念ドリフトを検出し、閾値を越えたときに再トレーニングをトリガーするパイプラインを構築することです。MLflowまたはWeights and Biasesが実験の追跡を担い、モデルレジストリがトレーニングデータからデプロイ済みアーティファクトまでの完全なリネージを提供します。
ポストトレーニングのアライメント:SFTを超えて
2026年の本番標準は、モジュール型のパイプラインです。すなわち、指示追従のためのSFT、選好アライメントのためのDPOまたはSimPO、そして推論のためのGRPOです。
DPOは報酬モデルを不要にすることでRLHF PPOに取って代わりました。SimPOは参照モデルを取り除きつつ、AlpacaEval 2においてDPOを6.4ポイント上回りました。GRPO(DeepSeek R1由来)は検証可能な報酬を用いて、純粋なRLによって推論を訓練し( グラフ強化学習に関する当社の研究で探求している手法です)、創発的な自己反省と検証をもたらします。私たちはこれらを、RLのトレーニングダイナミクスを正しく扱うフレームワークであるTRLを用いて実装します。
私たちが提供するもの
すべての取り組みは、デプロイ可能なシステムを生み出すようにスコープされます。
- 完全なモデルカードを備えたファインチューニング済みモデル。
- 実験追跡を伴う再現可能なコードとしてのトレーニングパイプライン。
- 精度、レイテンシ、堅牢性、キャリブレーションにわたって、ベースモデルおよび代替手段とベンチマーク比較する評価スイート。
- 最適化されたサービング設定を備えた量子化済みのデプロイメントアーティファクト。
- ドリフト検出と再トレーニングのトリガーを備えた監視ダッシュボード。
- 規制業界向けには、セクター固有の検証文書(EU AI Act、FDA、金融モデル検証)。
この取り組みはまた、誠実な評価も生み出します。すなわち、ファインチューニングが正しいアプローチだったか、モデルに何ができないか、そして性能の上限がどこにあるかです。事前に文書化された制約は、楽観的な見通しよりも多くの費用を節約します。
モデル開発とファインチューニング
材料回収と黒色プラスチック選別のためのAI | Veriprajna
カーボンブラック顔料は近赤外光を吸収します。光学選別機が見逃したすべての黒色PPトレイ、PE容器、ABS筐体は残渣となり、最終的に埋立処分されます。私たちは、それを回収するMWIRセンシングとエッジAIのレイヤーを構築します。
航空会社の乗務員スケジューリングAI:レガシーソルバーが破綻する場面で機能するIROPSリカバリー | Veriprajna
中堅航空会社向けのAI乗務員スケジューリングとIROPSリカバリー。JeppesenやIBSを置き換えず強化するMLで、連鎖的な運航障害、乗務員追跡のギャップ、DOT払い戻しエクスポージャーに対処します。
製薬・バイオテック向けバイオセキュリティAIセーフティ | Veriprajna
2022年、Collaborations Pharmaceuticalsは商用のde novo創薬モデルを、報酬関数を反転させた状態で稼働させました。6時間未満で、VXの類縁体を含む40,000種類の候補分子を生成しました。それがMegaSynです。2019年世代のLSTMで、1台のワークステーション上で動作していました。
Explore Solution →よくあるご質問
自社のドメインデータで70億モデルと700億モデルをファインチューニングするコストはどれくらいですか?
70億モデルのGPU計算コストは、A100インフラでトレーニング1イテレーションあたり$100〜$400で、プロジェクト総コスト(データキュレーション、評価、デプロイを含む)は小規模で$500〜$2,000、本番グレードのデプロイメントで$5,000〜$15,000の範囲です。700億モデルは800〜1,500 GPU時間を要し、実行あたり$4,000〜$9,750、本番プロジェクトでは通常$10,000〜$50,000の範囲となります。GPU料金が最大の明細項目になることは稀です。データキュレーション、SMEのアノテーション時間、安全性検証、規制対応文書が、計算コストを2〜5倍上回ることがしばしばあります。私たちはモデルサイズだけでなく、実際のタスクの複雑さとデータの準備状況に基づいてスコープします。
ファインチューニング、RAG、プロンプトエンジニアリングのどれを使うべきかは、いつ判断すべきですか?
問題を解決する最も安価なアプローチから始めましょう。プロンプトエンジニアリングは数時間で済み、コストはほとんどかかりません。RAGは1〜4週間かかり、モデルが学習していない最新の情報や独自の知識へのアクセスを必要とする場合に適した選択です。ファインチューニングは2〜8週間かかり、プロンプティングでは確実に生成できない新しい挙動、出力フォーマット、あるいはドメイン固有の推論をモデルに学習させる必要がある場合に正当化されます。2026年の本番標準はハイブリッドです。RAGが最新の事実を提供し、ファインチューニングがモデルの挙動を形作り、プロンプトエンジニアリングが出力品質を制御します。私たちはすべての取り組みを、ファインチューニングを推奨する前に、より単純なアプローチで問題が解決するかを検証することから始めます。
Axolotl、Unsloth、TRLのどのファインチューニング・フレームワークを使うべきですか?
それぞれが異なる問題を解決します。Unslothは単一GPU構成で最速であり、プロトタイピングに最適ですが、マルチGPUのFSDPは商用のProティアに限定されています。Axolotlは、YAML駆動の再現性を備えたマルチGPUトレーニングの本番標準です。TRLは、トレーニングの目的が最重要な場合、特にDPO、GRPO、PPO、あるいはあらゆる強化学習によるアライメント作業に使うものです。ほとんどの本番デプロイメントでは複数を併用します。すなわち、教師ありファインチューニングにはAxolotl、選好最適化にはTRL、迅速な実験にはUnslothです。私たちはトレーニングの規模、モデルアーキテクチャ、目的に基づいて選定します。
ファインチューニング中の破滅的忘却と安全性劣化をどのように防ぎますか?
標準的なファインチューニング設定は、いずれの問題に対する保護策もないまま出荷されます。EMNLP 2024の研究は、新しい事実知識でのファインチューニングがハルシネーションの傾向を増すことを示し、別の研究は、素朴なファインチューニングが安全性の拒否挙動を完全に無効化しうることを実証しました。私たちは安全性を保持するトレーニングパイプラインを実装します。すなわち、重要なモデル回路を保護する選択的LoRA、各モデルアーキテクチャに合わせて調整したLoRAランクのキャリブレーション、各トレーニングチェックポイントでのホールドアウト安全性ベンチマーク、タスク性能と能力の保持をバランスさせる複合指標に基づく早期停止、そして安全性が重要な層でのパラメータの乱れを最小化するスケーリング則に基づく学習率スケジュールです。
LLMを効果的にファインチューニングするために必要な最小のデータセットサイズはどれくらいですか?
タスクあたり1,000件の高品質な事例が、LoRAによる教師ありファインチューニングの実践的な最小値です。その閾値を下回ると過学習が支配的になり、few-shotプロンプティングやRAGの方が適しています。品質は量よりも重要です。アノテーター間一致度の高い、丁寧にキュレーションされた2,000件の事例は、ノイズの多い20,000件の事例を上回ります。選好最適化(DPO/SimPO)には、少なくとも5,000〜10,000件の選好ペアが必要です。検証可能な報酬を用いた強化学習(GRPO)では、要件はラベル付きデータから信頼できる検証関数へと移ります。私たちはお客様の既存データ資産を評価し、タスクに必要な品質閾値を満たすようアノテーションパイプラインを設計します。
エージェント型ワークフローで信頼性の高いツール呼び出しを実現するには、どうモデルをファインチューニングしますか?
そのままのモデルは、ツールのパラメータをハルシネーションしたり、誤った関数を選択したり、複数ステップのシーケンスに失敗したりすることが頻繁にあります。構造化されたツール呼び出しデータセットでのファインチューニングは、ベンチマークにおいて成功率を10%から79%へ改善し、ファインチューニング済みモデルは未知のシナリオにおいてベースモデルと比べて57%高いツール呼び出し報酬を示しました。このアプローチでは、正しい関数シグネチャ、パラメータ型、複数ステップの連鎖を含むツール呼び出しトレーニングデータをキュレーションし、SFTで、続いて実行フィードバックを報酬信号とする強化学習でファインチューニングします。私たちはトレーニングデータのパイプラインを構築し、モデルをトレーニングし、デプロイ前に実際のAPIサーフェスに対して検証します。
LoRA、QLoRA、フルファインチューニング:私たちのユースケースにはどのアプローチが適していますか?
フルファインチューニングはすべてのパラメータを更新し、最も高い性能上限をもたらしますが、70億パラメータを超えるものには8基以上のGPUが必要です。LoRAはベースモデルを凍結して小さなアダプタ行列をトレーニングし、本番のランク設定64〜128において最小限の品質損失で訓練可能なパラメータを90%以上削減します。QLoRAは凍結したベースモデルに4ビット量子化を加え、トレーニング時間が39%増える代わりにVRAMを33%削減します。ほとんどのエンタープライズのユースケースでは、ランク64〜128のLoRAが適切なデフォルトです。QLoRAはGPUメモリが本当に制約されている場合に。フルファインチューニングは、計算予算があり、それを正当化するデータセットサイズ(50,000件以上の事例)があり、すべてのパラメータの更新から明らかに恩恵を受けるタスクである場合にのみ選びます。
ファインチューニングしたAIモデルに対して、EU AI Actのコンプライアンスは何を要求しますか?
ファインチューニングが元モデルのトレーニング計算量の3分の1を超える計算量(元モデルが不明な場合は10^23 FLOPsの3分の1)を使用する場合、EU AI Actはあなたを新たなGPAIプロバイダーとみなし、完全なコンプライアンス義務を課します。すなわち、技術文書、モデルカード、著作物のサマリー、リスク評価です。高リスクAIシステムに対する完全な施行は2026年8月2日に始まり、罰金は最大3,500万ユーロまたは全世界の年間売上高の7%に達します。整合された技術標準(CEN/CENELEC JTC 21)はまだ最終化されておらず、2026年第4四半期を目標としています。私たちはArticle 11(1)およびAnnex IVの要件に整合したモデルカードと技術文書を作成し、現行の枠組みの下で防御可能かつ最終標準に適応可能な形で設計します。
オープンソースモデルをファインチューニングすべきか、それともベンダーのファインチューニングAPIを使うべきですか?
ベンダーAPI(GPT-4.1のトレーニングに約$3/MトークンのOpenAI、GeminiのGoogle Vertex、Small 3.1に$0.20/MのMistral)は、データガバナンスがトレーニングデータをサードパーティのインフラに送ることを許容する場合、迅速なイテレーションに適しています。オープンソースモデル(Llama 3、Mistral、Qwen)を自社ホスティングでトレーニングすることは、データが自社インフラ内に留まる必要がある場合、トレーニングダイナミクスの完全な制御が必要な場合、あるいは規制要件がそれを求める場合に適しています。2026年のほとんどのエンタープライズ・デプロイメントは両方を使います。すなわち、プロトタイピングとベースラインにはベンダーAPI、データ主権やコスト最適化が重要な本番にはオープンソースです。私たちはプラットフォームへの忠誠ではなく、お客様の制約に基づいてこの判断をナビゲートします。
ファインチューニングしたモデルがベースモデルより本当に優れているかを、どう評価しますか?
ホールドアウトのテストセットでの単純な精度は必要ですが、十分ではありません。私たちは以下を測定する評価スイートを構築します。すなわち、統計的有意性検定を伴うタスク固有の性能、ベースモデルの能力セット由来のホールドアウトベンチマークを用いた汎用能力の保持(破滅的忘却の検出)、標準化された安全性ベンチマークを用いた安全性アライメントの保持、本番負荷下でのレイテンシとスループット、キャリブレーション品質(モデルが自分の知らないことを把握しているか)、そしてトレーニングデータに起因するバイアスを捉えるために関連するサブグループごとに分解した性能です。この評価スイートは、一度きりのレポートではなく、再現可能なコードとしてモデルに付属します。
確かな信頼のもとに、AIを構築する。
次世代のエンタープライズAI構築において豊富な経験を持つチームと、ぜひご一緒ください。信頼できるAI戦略の設計・構築・導入を、私たちがお手伝いします。
Veriprajna ディープテック・コンサルティング は、ヘルスケア・金融・規制対応分野における安全性重視のAIシステム構築を専門としています。当社のアーキテクチャは確立されたプロトコルに照らして検証され、包括的なコンプライアンス文書を備えています。