פיתוח וכוונון עדין של מודלי AI

אימון מודלים מותאם וכוונון עדין יעיל-פרמטרים המספק מודלים לייצור עם יישור בטיחות שלם ותיעוד רגולטורי כלול.

רוב פרויקטי הכוונון העדין נכשלים עוד לפני שהאימון מתחיל

חשבון ה-GPU אינו החלק היקר בכוונון עדין ארגוני. מודל בגודל 7B פרמטרים עובר כוונון עדין על A100 יחיד תמורת $100–$400 בעלות מחשוב; מודל 70B עולה $4,000–$9,750 לכל ריצת אימון. מה שהורג פרויקטים הוא כל מה שמסביב ללולאת האימון: אצירת אלפי דוגמאות ספציפיות לתחום, מניעת שכחה של מה שהמודל כבר יודע, אימות שיישור הבטיחות שרד את האימון, קוונטיזציה להגשה בסביבת ייצור, ובניית צינור הניטור שתופס סחף (drift).

גרטנר צופה כי עד 2027, ארגונים ישתמשו במודלי AI קטנים וייעודיים למשימה פי שלושה יותר מ-LLM לשימוש כללי. השינוי כבר בעיצומו: 68% מהארגונים שכיווננו מודלים בעדינות ב-2024 דיווחו על שיפור של עד פי 3 בדיוק המשימה. אך הפער בין ניסוי במחברת (notebook) לבין פריסה בייצור הוא המקום שבו רוב הפרויקטים נתקעים. הגישה שלנו היא להנדס את הצינור המלא, לא רק את לולאת האימון (דיסציפלינה המפורטת ב מחקר שלנו על הנדסת מערכות מעבר לעטיפות API).

מתי כוונון עדין הוא הבחירה הנכונה (ומתי לא)

הנדסת prompt נמשכת שעות. RAG נמשך שבוע עד ארבעה שבועות. כוונון עדין נמשך שבועיים עד שמונה שבועות, כולל יצירת מערך נתונים, אימון, בדיקות בטיחות והקשחה לייצור. אנו פותחים כל התקשרות בהערכה האם כוונון עדין באמת נחוץ.

כווננו בעדינות כאשר:

  • המודל זקוק להתנהגות חדשה או לפורמטי פלט ש-prompting אינו יכול לייצר באופן אמין;
  • לתחום שלכם יש דפוסי היסק ייעודיים שמודלים גנריים מטפלים בהם באופן לא עקבי;
  • אתם זקוקים להסקה חסכונית בקנה מידה גדול — מודל 7B מכוונן ב-$0.20/M טוקנים מחליף 70B ב-$2/M;
  • אתם בונים מערכות agentic שבהן אמינות קריאת הכלים חשובה — SLM מכוונים שיפרו את הצלחת קריאות הכלים מ-10% ל-79% במבחני ביצועים (ראו הדגמה פעילה של מערכת תזמון agentic כזו).

אל תכווננו בעדינות כאשר:

  • הבעיה היא אחזור ידע (השתמשו ב-RAG);
  • מערך הנתונים כולל פחות מ-1,000 דוגמאות לכל משימה;
  • הנדסת prompt כבר משיגה דיוק מקובל;
  • מודל הבסיס משתנה מהר יותר מקצב האימון-מחדש שלכם.

כאשר RAG פותר את הבעיה וכוונון עדין רק יבזבז תקציב, הגישה שלנו היא לומר זאת בטרם נגדיר היקף אימון כלשהו, במקום למכור פרויקט שאינכם זקוקים לו. יושרה זו מובנית באופן שבו אנו מגדירים את היקף ההתקשרות.

בחירת המסגרת חשובה

נוף 2026 התגבש סביב כלים נבדלים, שכל אחד מהם פותר בעיה שונה.

מסגרתמתאים ביותר ל-מגבלות / הערות
Unslothהמהיר ביותר בהגדרות GPU יחידהגרסה בקוד פתוח אינה יכולה להתרחב מעבר ל-GPU אחד; FSDP מרובה-GPU שמור לשכבת Pro
Axolotlתקן הייצור לאימון מרובה-GPUשחזוריות מונחית-YAML על פני אשכולות A100 ו-H100
Hugging Face TRLכאשר יעד האימון הוא הדבר החשוב ביותרDPO, GRPO, PPO, או כל עבודת יישור מבוססת-RL
LLaMA-Factoryכוונון עדין ראשוני דרך ממשק וובנגיש, אך רוב הצוותים גדלים ומתקדמים ממנו במהירות
TorchTune (Meta)אינטגרציה נייטיבית ל-PyTorchעבור מערכת האקוסיסטם של מודלי Meta

אנו בוחרים על בסיס קנה מידה האימון, ארכיטקטורת המודל והיעדים שלכם. רוב הפריסות בייצור משתמשות ביותר מאחד: Axolotl לכוונון עדין מונחה, TRL לאופטימיזציית העדפות, ו-Unsloth לאב-טיפוס מהיר.

יישור בטיחות אינו שורד כוונון עדין נאיבי

מחקר EMNLP 2024 הדגים כי כוונון עדין של LLM על ידע עובדתי חדש מגביר את הנטייה להזיות. בנפרד, חוקרים מ-Princeton, Stanford, Virginia Tech ו-IBM הראו שכוונון עדין סטנדרטי אפשר למודלים לעקוף לחלוטין את אימון הבטיחות. מחקר ICLR 2026 הראה מאז שכוונון קפדני של היפר-פרמטרים ממתן סיכונים אלה, אך תצורות ברירת המחדל של ה-framework מגיעות ללא הגנות.

המנגנון: עדכוני פרמטרים אגרסיביים בשכבות העליונות דורסים תכונות האחראיות לבטיחות. בחירת דרגת LoRA היא קריטית — מתאמים בדרגה גבוהה יותר על שכבות תשומת הלב עלולים לערער מעגלי סירוב, והתצורה הבטוחה תלויה בארכיטקטורת המודל הספציפית ובנתוני המשימה.

הגישה שלנו היא ליישם צינורות משמרי-בטיחות (בהשראת מחקר שלנו על ממשל בטיחות AI במרחב הלטנטי):

  • LoRA סלקטיבי המגן על מעגלים קריטיים;
  • מבחני בטיחות שמורים (held-out) בכל נקודת ביקורת;
  • עצירה מוקדמת על בסיס מדדים מורכבים המאזנים בין ביצועי המשימה לבין שימור היכולות;
  • ניטור רציף להידרדרות היישור לאורך כל האימון.

אצירת נתונים היא צוואר הבקבוק האמיתי

שעות GPU הן סעיף בתקציב. אצירת נתונים היא הפרויקט:

  • גיוס מומחי תוכן (SME) לתיוג 5,000–50,000 דוגמאות באיכות גבוהה;
  • יישוב חילוקי דעות בתיוג באמצעות מדדי הסכמה בין-מתייגים;
  • הרצת ניכוי כפילויות MinHash/LSH;
  • בדיקת זיהום מול מערכי ההערכה;
  • תיעוד מקור הנתונים באמצעות datasheets.

RLAIF (בשימוש ב-GPT-4 כמתייג) מפחית עלות עבור נתוני העדפה אך מכניס הטיה של מודל-המורה. נתונים סינתטיים באמצעות זיקוק מורה-תלמיד מאתחלים מערכי אימון, אם כי האיכות מוגבלת על ידי יכולות מודל-המורה.

היקף ההתקשרות מוגדר לכסות תכנון צינור נתונים, זרימות עבודה של תיוג, אימות איכות, ותיעוד לתעשיות מפוקחות: אימות תוכנה של ה-FDA, דוחות אימות מודלים פיננסיים, ותיעוד טכני של חוק ה-AI של האיחוד האירופי עם כרטיסי מודל (model cards) העומדים בדרישות סעיף 11(1).

מאימון לייצור

קוונטיזציה

בצעו כוונון עדין ב-FP16, מזגו מתאמים, ואז בצעו קוונטיזציה. AWQ INT4 עם ליבת Marlin מספקת את יחס התפוקה-לאיכות הטוב ביותר עבור הגשת vLLM (741 tok/s). GPTQ משתלב עם TensorRT-LLM ו-TGI. GGUF הוא נייטיבי עבור llama.cpp ו-Ollama. אנו מתאימים את הקוונטיזציה למחסנית ההגשה שלכם.

ספק מסחרי מול קוד פתוח

OpenAI גובה כ-$3/M טוקנים לכוונון עדין של GPT-4.1. ה-Small 3.1 המכוונן של Mistral ב-$0.20/M משתווה ל-Large 3 שלהם ב-$2/M במשימות צרות. Anthropic אינה מציעה כוונון עדין ציבורי. ממשקי API של ספקים מתאימים לאיטרציה מהירה כאשר ממשל הנתונים מאפשר תשתית צד-שלישי.

מודלים בקוד פתוח (Llama 3, Mistral, Qwen) עם אימון מתארח-עצמית מתאימים כאשר הנתונים חייבים להישאר בתשתית שלכם או כאשר דרישות רגולטוריות מחייבות זאת. רוב הארגונים משתמשים בשניהם.

ניטור ואימון-מחדש

מודלים בייצור סוחפים. הגישה שלנו היא לבנות צינורות העוקבים אחר איכות החיזוי, מזהים סחף נתונים ומושגים, ומפעילים אימון-מחדש כאשר חוצים ספים. MLflow או Weights and Biases מטפלים במעקב הניסויים, בעוד שרישומי מודלים (model registries) מספקים ייחוס מלא מנתוני האימון ועד לארטיפקט הפרוס.

יישור לאחר-אימון: מעבר ל-SFT

תקן הייצור של 2026 הוא צינור מודולרי: SFT למעקב אחר הוראות, DPO או SimPO ליישור העדפות, ו-GRPO להיסק.

DPO החליף את RLHF PPO על ידי ביטול מודל התגמול. SimPO הסיר את מודל הייחוס תוך התעלות על DPO ב-6.4 נקודות ב-AlpacaEval 2. GRPO (מ-DeepSeek R1) משתמש בתגמולים ניתנים-לאימות כדי לאמן היסק דרך RL טהור (טכניקה שאנו חוקרים ב מחקר שלנו על למידת חיזוק על גרפים), עם התבוננות-עצמית ואימות מתהווים. אנו מיישמים אלה באמצעות TRL, המסגרת שמבצעת נכון את דינמיקת אימון ה-RL.

מה אנו מספקים

כל התקשרות מוגדרת בהיקף כדי לייצר מערכת ניתנת-לפריסה:

  • המודל המכוונן עם כרטיסי מודל (model cards) מלאים;
  • צינור האימון כקוד ניתן-לשחזור עם מעקב ניסויים;
  • חבילת הערכה המשווה מול מודל הבסיס וחלופות על פני דיוק, השהיה, חוסן וכיול;
  • ארטיפקט הפריסה המקוונטז עם תצורת הגשה מיטבית;
  • לוחות מחוונים לניטור עם זיהוי סחף וטריגרים לאימון-מחדש;
  • עבור תעשיות מפוקחות, תיעוד אימות ייעודי-מגזר (חוק ה-AI של האיחוד האירופי, FDA, אימות מודלים פיננסיים).

ההתקשרות מפיקה גם הערכה כנה: האם כוונון עדין היה הגישה הנכונה, מה המודל אינו יכול לעשות, והיכן ניצבת תקרת הביצועים. מגבלות מתועדות מראש חוסכות יותר כסף מתחזיות אופטימיות.

פיתוח וכוונון עדין של מודלי AI

Industrial & Manufacturing

בינה מלאכותית להשבת חומרים ולמיון פלסטיק שחור | Veriprajna

פיגמנט הפחם השחור בולע אור קרוב-אינפרא-אדום. כל מגש PP שחור, מיכל PE ומארז ABS שמסדק האופטי שלכם מפספס הולך לפסולת שיורית, ואז להטמנה. אנו בונים את שכבת החישה ב-MWIR ובינת הקצה שמשיבה אותו.

3-15%
of your waste stream is black plastic going to residue
83.4%
MWIR+CNN accuracy on real waste (peer-reviewed)
Explore Solution
Transport & Logistics

בינה מלאכותית לתכנון צוותי אוויר: התאוששות IROPS שעובדת כשפותרים מדור קודם נכשלים | Veriprajna

בינה מלאכותית לתכנון צוותי אוויר והתאוששות IROPS לחברות תעופה בגודל בינוני. הרחיבו את Jeppesen או IBS בלמידת מכונה שמתמודדת עם שיבושים מתגלגלים, פערי מעקב צוות וחשיפת החזרי DOT.

$60B/year
Industry IROPS cost
4-12 hours
Manual crew recovery time
Explore Solution
Healthcare & Life Sciences

בטיחות AI לביו-ביטחון לפארמה וביוטכנולוגיה | Veriprajna

בשנת 2022, חברת Collaborations Pharmaceuticals הריצה את מודל גילוי-התרופות המסחרי שלה ל-de novo עם פונקציית התגמול הפוכה. בפחות משש שעות הוא ייצר 40,000 מולקולות מועמדות, כולל אנלוגים של VX. זה היה MegaSyn, רשת LSTM מתקופת 2019, שרצה על תחנת עבודה בודדת.

Explore Solution
שאלות נפוצות

שאלות נפוצות

כמה עולה לכוונן בעדינות מודל 7B לעומת 70B על נתוני התחום שלנו?

מחשוב GPU עבור מודל 7B נע בין $100-$400 לכל איטרציית אימון על תשתית A100, כאשר עלויות הפרויקט הכוללות (כולל אצירת נתונים, הערכה ופריסה) נעות בין $500-$2,000 לפריסות בקנה מידה קטן ועד $5,000-$15,000 לפריסות בדרגת ייצור. מודל 70B דורש 800-1,500 שעות GPU בעלות של $4,000-$9,750 לכל ריצה, כאשר פרויקטי ייצור נמצאים בדרך כלל בטווח של $10,000-$50,000. חשבון ה-GPU רק לעתים רחוקות הוא הסעיף הגדול ביותר. אצירת נתונים, זמן תיוג של מומחי תוכן (SME), אימות בטיחות ותיעוד רגולטורי לעתים קרובות עולים על עלויות המחשוב פי 2-5. אנו מגדירים את ההיקף על בסיס מורכבות המשימה בפועל ומוכנות הנתונים שלכם, לא על בסיס גודל המודל בלבד.

מתי כדאי לנו לכוונן בעדינות לעומת להשתמש ב-RAG לעומת הנדסת prompt?

התחילו מהגישה הזולה ביותר שפותרת את הבעיה. הנדסת prompt נמשכת שעות ועולה כמעט כלום. RAG נמשך 1-4 שבועות והוא הבחירה הנכונה כאשר המודל זקוק לגישה לידע עדכני או קנייני שהוא לא אומן עליו. כוונון עדין נמשך 2-8 שבועות ומוצדק כאשר המודל צריך ללמוד התנהגות חדשה, פורמטי פלט, או היסק ספציפי-לתחום ש-prompting אינו יכול לייצר באופן אמין. תקן הייצור של 2026 הוא היברידי: RAG מספק עובדות עדכניות, כוונון עדין מעצב את התנהגות המודל, והנדסת prompt שולטת באיכות הפלט. אנו פותחים כל התקשרות בבדיקה האם הגישות הפשוטות יותר פותרות את הבעיה לפני שאנו ממליצים על כוונון עדין.

באיזה framework לכוונון עדין כדאי לנו להשתמש: Axolotl, Unsloth או TRL?

כל אחד פותר בעיה שונה. Unsloth הוא המהיר ביותר בהגדרות GPU יחיד ומצוין לאב-טיפוס, אך FSDP מרובה-GPU מוגבל לשכבת ה-Pro המסחרית שלהם. Axolotl הוא תקן הייצור לאימון מרובה-GPU עם שחזוריות מונחית-YAML. TRL הוא מה שמשתמשים בו כאשר יעד האימון הוא הדבר החשוב ביותר, בפרט עבור DPO, GRPO, PPO, או כל עבודת יישור מבוססת למידת חיזוק. רוב הפריסות בייצור משתמשות ביותר מאחד: Axolotl לכוונון עדין מונחה, TRL לאופטימיזציית העדפות, ו-Unsloth לניסויים מהירים. אנו בוחרים על בסיס קנה מידה האימון, ארכיטקטורת המודל והיעדים שלכם.

כיצד אנו מונעים שכחה קטסטרופלית והידרדרות בטיחות במהלך כוונון עדין?

תצורות סטנדרטיות של כוונון עדין מגיעות ללא הגנות מפני אף אחת מהבעיות. מחקר EMNLP 2024 הראה שכוונון עדין על ידע עובדתי חדש מגביר את הנטייה להזיות, ומחקרים נפרדים הדגימו שכוונון עדין נאיבי יכול להשבית לחלוטין את התנהגות סירוב הבטיחות. אנו מיישמים צינורות אימון משמרי-בטיחות: LoRA סלקטיבי המגן על מעגלים קריטיים במודל, כיול דרגת LoRA המותאם לכל ארכיטקטורת מודל, מבחני בטיחות שמורים (held-out) בכל נקודת ביקורת של האימון, עצירה מוקדמת על בסיס מדדים מורכבים המאזנים בין ביצועי המשימה לבין שימור היכולות, ולוחות זמנים של קצב למידה מבוססי חוקי-קנה-מידה הממזערים שיבוש פרמטרים בשכבות קריטיות-לבטיחות.

מהו גודל מערך הנתונים המינימלי הנדרש לכוונון עדין יעיל של LLM?

1,000 דוגמאות באיכות גבוהה לכל משימה הן המינימום המעשי לכוונון עדין מונחה עם LoRA. מתחת לסף זה, התאמת-יתר משתלטת ועדיף לכם prompting מעטות-דוגמאות (few-shot) או RAG. איכות חשובה יותר מכמות: 2,000 דוגמאות שנאצרו בקפידה עם הסכמה גבוהה בין-מתייגים מתעלות על 20,000 דוגמאות רועשות. עבור אופטימיזציית העדפות (DPO/SimPO), אתם זקוקים ללפחות 5,000-10,000 זוגות העדפה. עבור למידת חיזוק עם תגמולים ניתנים-לאימות (GRPO), הדרישה עוברת מנתונים מתויגים לפונקציית אימות אמינה. אנו מעריכים את נכסי הנתונים הקיימים שלכם ומתכננים את צינור התיוג כדי לעמוד בסף האיכות שהמשימה שלכם דורשת.

כיצד אנו מכווננים בעדינות מודל לקריאת כלים אמינה בזרימות עבודה agentic?

מודלים מהקופסה לעתים קרובות ממציאים פרמטרים של כלים, בוחרים פונקציות שגויות, או נכשלים ברצפים רב-שלביים. כוונון עדין על מערכי נתונים מובנים של קריאת כלים שיפר את שיעורי ההצלחה מ-10% ל-79% במבחני ביצועים, ומודלים מכוונים מציגים תגמולי קריאת כלים גבוהים ב-57% בתרחישים שלא נראו בהשוואה למודלי בסיס. הגישה כרוכה באצירת נתוני אימון לקריאת כלים עם חתימות פונקציה נכונות, סוגי פרמטרים, ושרשראות רב-שלביות, ואז כוונון עדין עם SFT ואחריו למידת חיזוק תוך שימוש במשוב הרצה כאות התגמול. אנו בונים את צינור נתוני האימון, מאמנים את המודל, ומאמתים מול משטח ה-API בפועל שלכם לפני הפריסה.

LoRA לעומת QLoRA לעומת כוונון עדין מלא: איזו גישה עבור מקרה השימוש שלנו?

כוונון עדין מלא מעדכן כל פרמטר ומספק את התקרה הגבוהה ביותר אך דורש 8+ GPU עבור כל דבר מעל 7B פרמטרים. LoRA מקפיא את מודל הבסיס ומאמן מטריצות מתאם קטנות, מפחית פרמטרים הניתנים לאימון ב-90%+ עם אובדן איכות מזערי בהגדרות דרגת ייצור של 64-128. QLoRA מוסיף קוונטיזציה של 4-ביט של מודל הבסיס הקפוא, חותך את זיכרון ה-VRAM ב-33% עם עלייה של 39% בזמן האימון. עבור רוב מקרי השימוש הארגוניים, LoRA בדרגה 64-128 הוא ברירת המחדל הנכונה. QLoRA כאשר זיכרון ה-GPU מוגבל באמת. כוונון עדין מלא רק כאשר יש לכם את תקציב המחשוב, את גודל מערך הנתונים המצדיק זאת (50,000+ דוגמאות), ומשימה שנהנית באופן מובהק מעדכון כל הפרמטרים.

מה דורשת עמידה בחוק ה-AI של האיחוד האירופי עבור מודלי AI מכוונים?

אם הכוונון העדין שלכם משתמש במחשוב העולה על שליש ממחשוב האימון של המודל המקורי (או שליש מ-10^23 FLOPs אם המקורי אינו ידוע), חוק ה-AI של האיחוד האירופי מתייחס אליכם כאל ספק GPAI חדש עם חובות עמידה מלאות: תיעוד טכני, כרטיסי מודל, סיכומי חומר המוגן בזכויות יוצרים, והערכות סיכונים. אכיפה מלאה למערכות AI בסיכון גבוה מתחילה ב-2 באוגוסט 2026, עם קנסות של עד 35 מיליון EUR או 7% מהמחזור השנתי הגלובלי. התקנים הטכניים המתואמים (CEN/CENELEC JTC 21) עדיין בשלבי גמר, ומכוונים לרבעון הרביעי של 2026. אנו מפיקים כרטיסי מודל ותיעוד טכני המתואמים לדרישות סעיף 11(1) ונספח IV, שתוכננו להיות ברי-הגנה במסגרות הנוכחיות ומותאמים לתקנים הסופיים.

האם עלינו לכוונן בעדינות מודל בקוד פתוח או להשתמש ב-API לכוונון עדין של ספק?

ממשקי API של ספקים (OpenAI בכ-$3/M טוקנים לאימון GPT-4.1, Google Vertex עבור Gemini, Mistral ב-$0.20/M עבור Small 3.1) מתאימים לאיטרציה מהירה כאשר ממשל הנתונים מאפשר שליחת נתוני אימון לתשתית צד-שלישי. מודלים בקוד פתוח (Llama 3, Mistral, Qwen) עם אימון מתארח-עצמית מתאימים כאשר הנתונים חייבים להישאר בתשתית שלכם, אתם זקוקים לשליטה מלאה על דינמיקת האימון, או כאשר דרישות רגולטוריות מחייבות זאת. רוב הפריסות הארגוניות ב-2026 משתמשות בשניהם: ממשקי API של ספקים לאב-טיפוס וקווי בסיס, קוד פתוח לייצור שבו ריבונות נתונים או אופטימיזציית עלויות חשובה. אנו עוזרים לכם לנווט בהחלטה זו על בסיס המגבלות שלכם, לא נאמנות לפלטפורמה.

כיצד אנו מעריכים האם המודל המכוונן שלנו באמת טוב יותר מהבסיס?

דיוק פשוט על מערך בדיקה שמור הוא הכרחי אך אינו מספיק. אנו בונים חבילות הערכה המודדות ביצועים ספציפיים-למשימה עם בדיקת מובהקות סטטיסטית, שימור יכולות כלליות תוך שימוש במבחני ביצועים שמורים ממערך היכולות של מודל הבסיס (תפיסת שכחה קטסטרופלית), שמירת יישור בטיחות תוך שימוש במבחני בטיחות מתוקננים, השהיה ותפוקה תחת עומס ייצור, איכות כיול (האם המודל יודע מה הוא אינו יודע), וביצועים מפורקים על פני תת-קבוצות רלוונטיות כדי לתפוס הטיה שהוכנסה על ידי נתוני האימון. חבילת ההערכה מגיעה עם המודל כקוד ניתן-לשחזור, לא דוח חד-פעמי.

בנו את ה-AI שלכם בביטחון.

שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.

Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.