מקוריות וסריקות נתונים (Data Provenance & Traceability)
אנו בונים תשתיות שושלת ומקוריות נתונים המתחקות אחר נתוני אימון AI מהמקור, דרך כל טרנספורמציה ועד למשקולות המודל, להוכחה רגולטורית ושליטה תפעולית.
מערכת ה-AI שלכם קיבלה החלטה. האם אתם יכולים להתחקות אחר הנתונים שמאחוריה?
מקוריות נתונים (Data provenance) היא התשתית שהופכת שאלות על נתוני AI לניתנות למענה — לא לוח מחוונים (dashboard) או רשומת קטלוג, אלא מערכת הלוכדת מהיכן נתוני האימון הגיעו, אילו טרנספורמציות הם עברו, אילו מודלים צרכו אותם, והאם שרשרת זו ניתנת לאימות קריפטוגרפי (ראו המחקר שלנו על ארכיטקטורת AI שניתן לאימות עבור הארגון בעידן פוסט-אמון).
בית משפט הורה זה עתה ל-OpenAI להציג 78 מיליון יומני פלט של ChatGPT משום שהתובעים נדרשו להתחקות אחר האופן שבו נתוני אימון המוגנים בזכויות יוצרים השפיעו על התנהגות המודל. זוהי דוגמה קיצונית. הגרסה היומיומית שקטה יותר, אך בעלת השלכות לא פחותות:
- רגולטור ששואל אילו נתונים שימשו לאימון מודל ההלוואות שלכם.
- בקשת מחיקה לפי GDPR שהגיעה לטבלאות המקור שלכם, אך לא לששת מודלי ההמשך שצרכו את הרשומות שנמחקו.
- תקרית הרעלת נתונים שבה אינכם יכולים לזהות אילו קבוצות אימון נפגעו, מכיוון שדבר בצינור הנתונים שלכם לא תיעד את התשובה.
הגישה שלנו היא לבנות שכבת מקוריות זו על פני כלי הצינור שארגונים כבר מפעילים: Spark, dbt, Airflow, Dagster, ו-ETL מותאם אישית.
מדוע שושלת בקטלוג נתונים אינה זהה למקוריות נתוני אימון
רוב הארגונים כבר מחזיקים בקטלוג מטא-דאטה. Collibra, Alation, Atlan, או DataHub מכסים שושלת ברמת הטבלה המועילה לניתוח השפעות של שינויי סכמה. אולם הם אינם עונים על השאלות שרגולטורים, מבקרי פנים ומתדיינים משפטיים שואלים לגבי מערכות AI. הפער בא לידי ביטוי בשלושה היבטים:
| ממד | שושלת בקטלוג | מקוריות נתוני אימון |
|---|---|---|
| רמת פירוט (גרנולריות) | עוקב אחר מערכי נתונים, לא אחר רשומות בודדות | ברמת הרשומה — נדרש לפי סעיף 17 ל-GDPR כדי לזהות כל תוצר המשך ששילב נתונים של נושא מידע, כולל משקולות מודל |
| גבול | נעצר בגבול המודל; MLflow או Weights and Biases מכירים את גרסת מערך הנתונים, אך לא אילו רשומות נכללו, איזה עיבוד מקדים הוחל, או כיצד דוגמאות השפיעו על ההתנהגות | מתרחב דרך שלבי העיבוד המקדים ואל תוך האופן שבו דוגמאות ספציפיות השפיעו על התנהגות המודל |
| שלמות ואמינות (Integrity) | סביל, ללא הבטחת שלמות — מהנדס הדורס טבלת staging אינו משאיר עקבות | מקוריות קריפטוגרפית מאפשרת לזהות שיבושים |
הגישה שלנו פועלת עם כל קטלוג שבו אתם כבר משתמשים. שכבת המקוריות מתוכננת לשבת מתחתיו, תוך ניטור (instrumentation) של ביצוע הצינור בפועל כדי ללכוד את הפירוט ברמת הרשומה והטרנספורמציה שקטלוגים לא תוכננו לספק.
מה אנחנו מנטרים וכיצד
האתגר המרכזי הוא לכידת מקוריות ברמת הפירוט הנדרשת על ידי רגולטורים מבלי לפגוע אנושות בתפוקת הצינור. גיבוב SHA-256 לכל רשומה בעבודת Spark המעבדת 500 מיליון שורות מוסיף 15%–40% תקורה — דבר שלעיתים נדירות מתקבל בסביבת ייצור. הגישה שלנו מכיילת את רמת הפירוט של המקוריות לפרופיל הסיכון הממשי.
| פרופיל סיכון של הצינור | גישת המקוריות | תקורה |
|---|---|---|
| צינורות בסיכון גבוה המזינים AI מוסדר (דירוג אשראי, תמיכה בהחלטות קליניות, זיהוי הונאות) | עצי Merkle לכל אצווה: גיבוב ממוען-תוכן ברמת המחיצה (partition) עם אימות שורש Merkle על פני האצווה כולה, המספקים עדות לשיבוש | תקורה של 2%–5% על התפוקה |
| צינורות אנליטיים בסיכון נמוך יותר | מקוריות מבוססת מטא-דאטה בלבד: מזהי מקור, פרמטרים של טרנספורמציה וגרסאות תוכנה, ללא גיבוב לכל רשומה | קרובה לאפס — מספקת תיעוד רגולטורי מלא |
ניטור הצינור באמצעות OpenLineage
הניטור משתמש ב- OpenLineage כתקן פליטה שבו קיימות אינטגרציות (ל-Spark, Airflow, dbt ו-Dagster יש רמות תמיכה שונות), עם היבטים (facets) מותאמים אישית הלוכדים מטא-דאטה ספציפי ל-ML: פרמטרי הנדסת תכונות, תצורות הרחבת נתונים, אסטרטגיות דגימה וקריטריונים לחלוקת אימון/תיקוף/בדיקה. במקומות שבהם האינטגרציה עם OpenLineage אינה שלמה או משמיטה אירועים — מאזין ה-Spark ידוע באיבוד שקט של facets מותאמים אישית תחת ספירת מחיצות גבוהה — הגישה מוסיפה ניטור משלים שנועד ללכוד את מה שהאינטגרציה הסטנדרטית מפספסת, כמפורט ב- המאמר הטכני שלנו על אבטחת שרשרת האספקה של ML לאורך מחזור החיים.
מקוריות עבור נתונים לא מובנים
עבור נתוני אימון לא מובנים — מסמכים, תמונות, שמע ווידאו המשמשים בצינורות כוונון עדין או RAG — הגישה מיישמת טביעת אצבע לתוכן באמצעות גיבוב תפיסתי (perceptual hashing) (pHash עבור תמונות, chromaprint עבור שמע) לצד גיבובים קריפטוגרפיים, מה שמאפשר מעקב מקוריות גם כאשר התוכן עובר טרנספורמציה עם אובדן נתונים — ראו הדגמה פעילה של מעקב מקוריות שמע.
בעיית המחיקה לפי GDPR שאיש טרם פתר באופן נקי
GDPR סעיף 17 מעניק את הזכות למחיקה. במאגרי נתונים מסורתיים, פשוט מוחקים ומאשרים. במערכות AI, זוהי בעיה בלתי פתורה המחופשת לתיבת סימון של תאימות. מודלי שפה גדולים אינם מאחסנים נתונים כרשומות בדידות — הם מאחסנים דפוסים סטטיסטיים הנגזרים מנתוני האימון, המפוזרים על פני מיליארדי פרמטרים. מחיקת נתוניו של אדם מטבלת המקור אינה מסירה את השפעתם ממשקולות המודל, וה-GDPR אינו מציע מסגרת לפרשנות מהי "מחיקה" ברגע שנתונים נספגו בארכיטקטורת קבלת ההחלטות של המודל.
המחקר על ביטול למידה של מכונה (Machine unlearning) מתקדם. ב- ספטמבר 2025, חוקרים מ-UC Riverside הדגימו "ביטול למידה ללא מקור", שיטה מאומתת הפועלת ללא נתוני האימון המקוריים, באמצעות מערכי נתונים פונדקאיים והתאמת פרמטרים המבוססת על עדכון ניוטון. אולם אף שיטת ביטול למידה אינה מוכנה לסביבת ייצור בקנה מידה ארגוני. גישות מעשיות נוכחיות משלבות שלוש שכבות:
- מניעה — שמירת מידע מזהה אישי (PII) מחוץ לנתוני האימון באמצעות שערי עיבוד מקדים.
- תיקון מהיר — מחיקה מאינדקסי אחזור, מטמונים (caches) ויומנים.
- תיעוד בר-הגנה — רישומי מקוריות המוכיחים אילו נתונים נכנסו לאילו מודלים, ותומכים בהחלטות אימון מחדש כאשר ביטול למידה אינו מספק.
תשתית המקוריות מתוכננת ליצור את תנאי הסף לכל אסטרטגיית מחיקה: מפה הניתנת לשאילתה ממזהה נושא המידע לכל מודל, צינור ותוצר שצרכו את נתוניו. בעזרתה, אתם עונים על השאלה "אילו מודלים זקוקים לאימון מחדש?" תוך דקות מקבלת בקשת מחיקה, במקום לגלות חודשים לאחר מכן שריצת כוונון עדין שנשכחה השתמשה בנתונים המושפעים.
סעיף 10 ל-EU AI Act: ממסמכי מדיניות לראיות מצינור הנתונים
סעיף 10 ל-EU AI Act דורש כי נתוני אימון, תיקוף ובדיקה יהיו כפופים ל"נהלי ממשל וניהול נתונים המתאימים למטרה המיועדת". האכיפה מתחילה ב- 2 באוגוסט 2026. הדרישה המעשית אינה מסמך מדיניות ממשל. היא ראיה ניתנת לאימות ובעלת חותמת זמן לכך שממשל נתונים יושם ברגע שבו הנתונים נכנסו לצינור.
הפער ממשי: רק 3% ממוסדות הפיננסים פרסו ביעילות AI בסביבת ייצור (דוח אמון הנתונים של Ataccama לשנת 2025). מדיניות ממשל קיימת, אך הוכחה ברמת הצינור לעמידה בה אינה בנמצא.
הגישה שלנו מספקת עמידה בסעיף 10 כיכולת מובנית בצינור. כל ריצה מתוכננת להפיק רישום מקוריות הלוכד: מקורות נתונים עם מטא-דאטה של מוצאם, תוצאות אימות איכות, פרמטרים של טרנספורמציה, מתודולוגיית דגימה, מאפיינים סטטיסטיים של מערך הנתונים (ייצוגיות, שלמות, שיעורי שגיאות) ומדיניות ממשל פעילה. זהו התוצר שמבקר בוחן — מופק אוטומטית, ולא מורכב בדיעבד.
עבור ארגונים הכפופים גם ל- סעיף 30 ל-GDPR (תיעוד פעילויות עיבוד), מערכת המקוריות מתוכננת להפיק את שני תוצרי התאימות מתוך שכבת ניטור יחידה. הדרישות חופפות אך אינן זהות: סעיף 30 מתמקד במטרות העיבוד ובבסיסים המשפטיים, בעוד שסעיף 10 מתמקד באיכות הנתונים ובייצוגיות. מערכת מאוחדת מונעת את הכפילות המעיקה על ארגונים המפעילים מסלולי תאימות נפרדים.
ייחוס נתוני אימון וזיהוי הרעלה
רגולטורים מתחילים לשאול אילו דוגמאות אימון השפיעו על תחזית מסוימת. פונקציות השפעה (Influence functions), המסגרת המתמטית לכך, היו היסטורית יקרות מדי לסביבת ייצור. התפתחויות אחרונות — הטלת גרדיאנט של LoGra וכן אלגוריתם ASTRA — מביאים את חישוב ההשפעה לקנה מידה מעשי. הגישה שלנו מיישמת ייחוס כיכולת פורנזית: ציוני השפעה מחושבים מראש עבור התנהגויות מודל קריטיות, הנשמרים במטמון לאחזור מהיר כאשר מבקר או מתדיין משפטי זקוקים לקשר שבין פלט ספציפי לבין הנתונים שמאחוריו.
מקוריות משמשת גם כקו ההגנה העיקרי נגד הרעלת נתוני אימון (המחקר שלנו על הגנה על מודלים ארגוניים מפני הרעלה). מחקר מ-2025 אישר כי הרעלה דורשת מספר קבוע בלבד של דגימות ללא תלות בגודל המודל, ואפילו 0.001% של נתונים עוינים עלולים לפגוע בדיוק ב-30%. כאשר לכל אלמנט נתונים יש שרשרת משמורת מאומתת, דפוסי מקוריות חריגים ניתנים לזיהוי:
- נתונים ממקורות לא מאומתים.
- רשומות עם שרשראות גיבוב שבורות.
- דוגמאות העוקפות את צינור הקליטה הסטנדרטי.
על גבי גרף המקוריות, הגישה מוסיפה שכבות זיהוי שנועדו לסמן דפוסים אלה בדגל בטרם נתונים מזוהמים מגיעים לאימון המודל.
מתי זו ההשקעה הנכונה
אתם זקוקים לתשתית מקוריות כאשר מערכות ה-AI שלכם צורכות נתונים בעלי סיכון משפטי, רגולטורי או בטיחותי:
- חברות שירותים פיננסיים הניצבות בפני סעיף 10 ל-EU AI Act.
- מערכות בריאות הכפופות ל- FDA 21 CFR Part 11.
- ארגונים בעלי חשיפה ל-GDPR המאמנים על נתוני משתמשים.
- ארגונים שמקורות נתוני האימון שלהם נתונים לבדיקה משפטית.
אינכם זקוקים לכך אם ה-AI שלכם צורך אך ורק נתוני צד ראשון בלתי מוסדרים בצינור פשוט. אם גרף השושלת של dbt יחד עם מופע DataHub מכסים את צורכיכם, השתמשו בהם — אנו נאמר לכם זאת כבר בשיחה הראשונה.
עיקרי הדברים
- שושלת בקטלוג עוקבת אחר מערכי נתונים בגבול המודל ללא הבטחת שלמות; AI מוסדר זקוק למקוריות ברמת הרשומה הניתנת לאימות קריפטוגרפי מתחת לקטלוג שכבר בבעלותכם.
- הגישה שלנו מותאמת לסיכון הממשי: מקוריות מבוססת מטא-דאטה בלבד עבור צינורות בסיכון נמוך יותר (תקורה קרובה לאפס), שרשראות קריפטוגרפיות מלאות של עצי Merkle לכל אצווה עבור מערכות מוסדרות (2%–5% תקורה לעומת 15%–40% עבור SHA-256 לכל רשומה).
- מקוריות היא תנאי הסף למחיקה לפי סעיף 17 ל-GDPR, לראיות לפי סעיף 10 ל-EU AI Act (אכיפה מ-2 באוגוסט 2026), לייחוס נתוני אימון ולזיהוי הרעלה.
- מחיר חוסר הפעולה הוא מוחשי: קנסות של עד 15 מיליון אירו או 3% מהמחזור העולמי, 40% יותר זמן לניפוי שגיאות ללא שושלת, ויותר מ-51 תביעות זכויות יוצרים ההופכות את המקוריות לתנאי סף בהתדיינות משפטית.
מקוריות וסריקות נתונים (Data Provenance & Traceability)
רישוי, סימון מים ומקור (Provenance) של אודיו מבוסס בינה מלאכותית עבור מדיה | Veriprajna
אנו בונים צינורות מקור (provenance) אודיו מקצה לקצה עבור חברות תקליטים, DSPs, מפיצים וסוכנויות פרסום. הטמעה וזיהוי של סימני מים, אישורי תוכן C2PA, גילוי AI לפי DDEX, המרת קול מורשית, תהליכי הסרה (takedown), ושרשרת בעלות (chain of title) ברמת שיפוי. שעון סעיף 50 נמצא במרחק 4 חודשים.
אבטחת שרשרת אספקה של AI ושלמות מודלים | Veriprajna
ייעוץ אבטחת שרשרת אספקה של AI. אנו בונים צינורות בדיקת מודלים, ארכיטקטורת ML-BOM וממשל AI צללים עבור מנהלי אבטחת מידע (CISO) בארגונים מפוקחים. תואם NIST AI 100-2 ו-EU AI Act.
שאלות נפוצות
כמה עולה להטמיע תשתית מקוריות נתונים ארגונית?
העלות תלויה במורכבות הצינור, ברמת הפירוט של המקוריות ובחשיפה הרגולטורית. מקוריות מבוססת מטא-דאטה בלבד (מעקב מקור, פרמטרים של טרנספורמציה, גרסאות תוכנה) מוסיפה תקורה קרובה לאפס לצינור ודורשת בדרך כלל 4–8 שבועות של עבודת ניטור. מקוריות קריפטוגרפית מלאה עם עצי Merkle לכל אצווה ועקיבות ברמת הרשומה דורשת 8–16 שבועות ומוסיפה תקורה של 2%–5% על התפוקה בצינורות המנוטרים. העלות החלופית גבוהה בהרבה: קנסות אי-ציות ל-EU AI Act מגיעים ל-15 מיליון אירו או 3% מהמחזור השנתי העולמי, וצוותים ללא שושלת משקיעים 40% יותר זמן בניפוי שגיאות נתונים. אנו מגדירים את ההיקף לפי פרופיל הסיכון הממשי, ולא לפי מנוי לפלטפורמה.
מה קורה כאשר בקשת מחיקה לפי GDPR מגיעה לנתונים שכבר שימשו לאימון מודל AI?
זוהי הבעיה הפתוחה הקשה ביותר בתאימות AI. מחיקת רשומות מטבלאות מקור אינה מסירה את השפעתן ממשקולות המודל, שבהן הנתונים מאוחסנים כדפוסים סטטיסטיים מבוזרים על פני מיליארדי פרמטרים. שיטות ביטול למידה של מכונה (Machine unlearning) מתקדמות (חוקרי UC Riverside הדגימו ביטול למידה מאומת ללא מקור בספטמבר 2025), אך אף אחת מהן אינה מוכנה לייצור בקנה מידה רחב. הגישה המעשית משלבת שלוש שכבות: מניעה (הרחקת PII מנתוני אימון באמצעות שערי עיבוד מקדים), תיקון מהיר (מחיקה מאינדקסי אחזור, מטמונים ויומנים), ותיעוד בר-הגנה באמצעות רישומי מקוריות המוכיחים אילו נתונים נכנסו לאילו מודלים, מה שמאפשר אימון מחדש ממוקד כאשר ביטול למידה אינו מספיק. מערכת המקוריות שאנו בונים מספקת את תנאי הסף: מפה הניתנת לשאילתה ממזהה נושא המידע לכל מודל, צינור ותוצר שצרכו את נתוניו.
כיצד אוכל לציית לדרישות ממשל הנתונים של סעיף 10 ל-EU AI Act?
סעיף 10 דורש כי נתוני אימון, תיקוף ובדיקה עבור מערכות AI בסיכון גבוה יהיו כפופים לנהלי ממשל נתונים נאותים. האכיפה מתחילה ב-2 באוגוסט 2026. הדרישה אינה מסמך מדיניות. היא ראיה ניתנת לאימות ובעלת חותמת זמן לכך שממשל נתונים יושם בעת כניסת הנתונים לצינור. אנו בונים זאת כיכולת מובנית בצינור: כל ריצה מפיקה רישום מקוריות הלוכד מקורות נתונים עם מטא-דאטה של מוצאם, תוצאות אימות איכות בקליטה, פרמטרים של טרנספורמציה, מתודולוגיית דגימה, מאפיינים סטטיסטיים של מערך הנתונים המתקבל, ומדיניות הממשל שהייתה בתוקף באותה עת. עבור ארגונים הכפופים גם לסעיף 30 ל-GDPR, שני תוצרי התאימות מופקים משכבת ניטור יחידה.
מדוע שושלת בקטלוג המטא-דאטה שלנו אינה מספקת למקוריות נתוני אימון AI?
קטלוגים כגון Collibra, Alation, Atlan ו-DataHub עוקבים אחר שושלת ברמת הטבלה: אילו טבלאות מזינות אילו טבלאות. זה מועיל לניתוח השפעות של שינויי סכמה, אך אינו מספיק לתאימות רגולטורית של AI. קיימים שלושה פערים. ראשית, קטלוגים עוקבים אחר מערכי נתונים ולא אחר רשומות בודדות, כך שלא ניתן להתחקות אחר רשומות של נושא מידע ספציפי עד למשקולות המודל לצורך מחיקת GDPR. שנית, שושלת בקטלוג נעצרת בגבול המודל: MLflow מכיר את גרסת מערך הנתונים, אך לא אילו רשומות נכללו או איזה עיבוד מקדים הוחל. שלישית, שושלת בקטלוג היא סבילה ללא הבטחות שלמות; מהנדס הדורס טבלת staging אינו משאיר עקבות. תשתית מקוריות עם אימות קריפטוגרפי מגשרת על פערים אלה ופועלת לצד הקטלוג הקיים שלכם.
כיצד מקוריות נתונים מסייעת בזיהוי הרעלת נתוני אימון?
מחקר מ-2025 אישר כי הרעלה דורשת מספר קבוע בלבד של דוגמאות ללא תלות בגודל המודל, ואפילו 0.001% של נתונים עוינים עלולים לפגוע בדיוק ב-30%. מחקר מסוף 2025 על Harmless Input Poisoning הראה שניתן להחדיר דלתות אחוריות (backdoors) עם נתונים הנראים תמימים, מה שהופך זיהוי מבוסס-תוכן לבדו לבלתי מספק. תשתית מקוריות מספקת את ההגנה המשלימה: שרשרת משמורת מאומתת מהמקור ועד לצינור מאפשרת לזהות דפוסי מקוריות חריגים. נתונים המופיעים ממקורות לא מאומתים, רשומות בעלות שרשראות גיבוב שבורות המעידות על שינוי לאחר הקליטה, או דוגמאות העוקפות את הקליטה הסטנדרטית מסומנים בדגל לפני שנתונים מזוהמים מגיעים לאימון המודל.
האם ניתן להטמיע מקוריות נתונים מבלי לכתוב מחדש את הצינורות הקיימים שלי?
כן. אנו מנטרים צינורות קיימים באמצעות פליטת אירועים תואמת OpenLineage עבור Spark, dbt, Airflow ו-Dagster, ומחדירים לכידת שושלת בשכבת התזמור והביצוע מבלי לשנות את הלוגיקה העסקית של הצינור. במקומות שבהם אינטגרציות טבעיות של OpenLineage אינן שלמות (מאזין ה-Spark משמיט היבטים מותאמים אישית תחת ספירת מחיצות גבוהה, ושושלת dbt מכסה רק מודלים של dbt), אנו בונים ניטור משלים כדי למלא את הפערים. עבור מערכות ETL מותאמות אישית ללא אינטגרציה סטנדרטית, אנו מוסיפים ווי ניטור (hooks) קלי משקל הפולטים אירועי מקוריות לאותו מאגר שושלת. המטרה היא לכידת מטא-דאטה של מקוריות משכבת הביצוע, ולא כתיבה מחדש של הטרנספורמציות עצמן.
מהו ייחוס נתוני אימון ומתי אני זקוק לו?
ייחוס נתוני אימון מזהה אילו דוגמאות אימון השפיעו על תחזית ספציפית של המודל. הוא משתמש בפונקציות השפעה (influence functions) כדי לכמת את הקשר המתמטי שבין נתוני האימון להתנהגות המודל. התפתחויות אחרונות (הטלת גרדיאנט של LoGra, אלגוריתם ASTRA עם טור ניומן מותנה מראש ב-EKFAC) הפכו זאת לאפשרי חישובית בקנה מידה רחב. אתם זקוקים לייחוס כאשר אתם מתמודדים עם שאלות רגולטוריות לגבי הסיבה לכך שהמודל קיבל החלטה ספציפית (דרישות הסברתיות של EU AI Act), התדיינות משפטית בנושאי זכויות יוצרים הדורשת הוכחה להשפעת נתוני אימון על פלטים, או ניפוי שגיאות פנימי במודל שבו עליכם לזהות אילו דוגמאות אימון אחראיות להתנהגויות בעייתיות. אנו מיישמים זאת כיכולת פורנזית: ציוני השפעה מחושבים מראש עבור התנהגויות מודל קריטיות, הנשמרים במטמון לאחזור מהיר.
כיצד אתם מטפלים במקוריות עבור נתונים לא מובנים המשמשים באימון LLM?
נתונים לא מובנים (מסמכים, תמונות, שמע, וידאו) המשמשים בצינורות כוונון עדין או RAG דורשים טכניקות מקוריות שונות מאשר נתונים טבלאיים. אנו מיישמים טביעת אצבע לתוכן עם גיבוב תפיסתי (pHash לתמונות, chromaprint לשמע) לצד גיבובים קריפטוגרפיים. גיבובים תפיסתיים מאפשרים מעקב מקוריות גם כאשר תוכן עובר טרנספורמציות עם אובדן נתונים (שינוי גודל, המרת פורמט, דחיסה) המשנות גיבובים קריפטוגרפיים. עבור מאגרי מסמכים המשמשים ב-RAG, אנו משלבים גיבוב קריפטוגרפי ברמת המסמך עם מקוריות ברמת המקטע (chunk) העוקבת אחר המקטעים שאוחזרו עבור שאילתות ספציפיות, ומאפשרים עקיבות מקצה לקצה ממסמך המקור, דרך האחזור ועד לפלט שנוצר.
בנו את ה-AI שלכם בביטחון.
שותפו עם צוות בעל ניסיון עמוק בבניית הדור הבא של AI ארגוני. אנו נסייע לכם לתכנן, לבנות ולהטמיע אסטרטגיית AI שתוכלו לסמוך עליה.
Veriprajna ייעוץ דיפ-טק מתמחה בבניית מערכות AI קריטיות לבטיחות עבור תחומי הבריאות, הפיננסים והרגולציה. הארכיטקטורות שלנו מאומתות מול פרוטוקולים מבוססים ומלוות בתיעוד ציות מקיף.