אנחנו חיים בעידן שבו הבינה המלאכותית הולכת ומשתלטת על כל חלקה טובה ברשת, והגבול בין מציאות לדמיון מעולם לא היה מטושטש יותר. אם בעבר יכולנו לזהות בקלות סרטון מזויף בזכות אצבעות מוזרות, תנועות עיניים לא טבעיות או עיוותים ברקע, הרי שהדור הנוכחי של כלי ה-AI כבר חצה את הקווים האלה מזמן. כיום, כל סרטון או תמונה שאתם רואים בפיד שלכם עלולים להיות תוצר של אלגוריתם מתוחכם, מבלי שיהיה לכם סיכוי אמיתי להבחין בכך בעין בלתי מזוינת.
בדיוק לתוך הוואקום המדאיג הזה נכנסת ענקית החומרה Nvidia. החברה, שהיא כנראה המרוויחה הגדולה ביותר ממהפכת ה-AI הנוכחית בזכות כרטיסי המסך ומעבדי השרתים שלה, החליטה לקחת אחריות גם על הצד השני של המתרס. החברה השיקה לאחרונה כלי חדשני בשם Synthetic Video Detector (או בקיצור SVD), שנועד להילחם בתעשיית ה-Deepfakes והמידע הכוזב המציף את הרשתות החברתיות וערוצי החדשות.
איך המוח הדיגיטלי של Nvidia מזהה זיופים?
הטכנולוגיה החדשה אינה סתם עוד מסנן פשוט, אלא מיקרו-שירות מתקדם (Nvidia Inference Microservice - או בקיצור NIM). השירות החדש פותח כחלק מתוכנית מיוחדת של החברה המיועדת לגופי מדיה ושידור. במקום לנסות ולנתח את קובץ הווידאו כולו כמקשה אחת – משימה כבדה ואיטית במיוחד – המערכת של Nvidia מפרקת את הסרטון לגורמים ומנתחת אותו פריים אחר פריים בזמן אמת.
בשלב הראשון, המערכת חותכת את הפריימים של הסרטון לרזולוציה אחידה של 504x504 פיקסלים. לאחר מכן, הפריימים הללו נשלחים ישירות לשני מודלי ראייה ממוחשבת עוצמתיים מסוג Vision Transformers שפותחו על ידי חברת Meta: הדגמים DINOv2 ו-DINOv3. מודלים אלו מצטיינים בזיהוי דפוסים וצורות במרחב מבלי שהיו זקוקים לתיוג אנושי מראש, מה שמאפשר להם להבחין באנומליות זעירות שהעין האנושית פשוט תפספס.
במהלך הניתוח, כל פריים מקבל ציון שנע בין 0 (סרטון אמיתי לחלוטין) ל-1 (זיוף מוחלט של בינה מלאכותית). בסופו של התהליך, המערכת משקללת את כל הציונים של הפריימים ומציגה למשתמש אחוז דיוק סופי המעיד על אמינות הווידאו. שיטה זו מאפשרת לערוצי טלוויזיה, סוכנויות ידיעות וגופי תוכן לאמת סרטונים שמגיעים מהשטח במהירות חסרת תקדים ולמנוע הפצת פייק ניוז.
ביצועים מטורפים ודיוק ברמת הפיקסל
אחד הנתונים המרשימים ביותר של ה-SVD הוא מהירות העבודה שלו, שמזכירה זמני תגובה של גיימרים מקצועיים במפרט קצה. המערכת מסוגלת לנתח וידאו ברזולוציית 1080p בתוך זמן עיבוד פנומנלי של 22 מילי-שניות בלבד על גבי כרטיסי מסך צרכניים מסדרת Nvidia GeForce RTX. אם תריצו את הכלי על חומרת תחנות עבודה מקצועיות, זמן העיבוד יעמוד על כ-30 מילי-שניות – נתון מדהים המאפשר לעבוד תוך כדי שידור חי.
מבחינת אחוזי ההצלחה, מדובר בבשורה של ממש עבור תעשיית החדשות. כאשר המערכת מנתחת קובץ וידאו מקורי שאינו דחוס, רמת הדיוק שלה מגיעה ל-92% אחוזים. עם זאת, במציאות של ימינו רוב הסרטונים מועלים לרשתות חברתיות כמו טוויטר או טיקטוק, שם הם עוברים דחיסה אגרסיבית שמטשטשת את עקבות ה-AI. למרבה השמחה, האלגוריתם של Nvidia מצליח להתגבר גם על המכשול הזה.
במצבים שבהם הווידאו עובר דחיסה קלה של 15%, הדיוק נשמר ברמה גבוהה מאוד של כ-87%. גם כאשר מדובר בדחיסה כבדה והרסנית במיוחד של 50%, המערכת עדיין פוגעת במטרה ב-82% מהמקרים. המודלים של Meta מצליחים "לראות" דרך הפיקסלים המטושטשים ולזהות את עקבות המברשת הדיגיטלית שהשאירה הבינה המלאכותית שייצרה את הסרטון מלכתחילה.
דרישות החומרה ומבט אל העתיד של השידורים החיים
כדי להריץ את ה-SVD החדש, המשתמשים יזדקקו לחומרה מודרנית התומכת במאיץ הקידוד המפורסם של החברה, ה-NVENC. דרישה זו יוצרת מצב מעניין למדי בשוק החומרה: מאיצי בינה מלאכותית מפלצתיים המיועדים למרכזי נתונים, כמו ה-Blackwell B100, אינם כוללים את המאיץ הזה באופן מובנה, ולכן לא יוכלו להריץ את כלי הזיהוי הזה בצורה ישירה ללא חומרת עזר מתאימה.
על מנת להפוך את הכלי לנגיש ושימושי עבור הקהל הרחב והתעשייה, Nvidia כבר הכריזה על שיתוף פעולה הדוק עם חברת Wowza, במטרה לשלב את מנגנון הזיהוי ישירות בתוך פלטפורמות של הזרמת וידאו ושידורים חיים ברשת. השאיפה היא שבעתיד הקרוב, פלטפורמות סטרימינג יוכלו לסמן לצופים באופן אוטומטי ובזמן אמת האם השידור שהם צופים בו כעת הוא אמיתי או תוצר של מניפולציה דיגיטלית.
עבור הסקרנים שרוצים לנסות את הטכנולוגיה בעצמם, גרסת דמו זמינה כעת באתר הפיתוח של החברה. עם זאת, כדאי לקחת בחשבון שמדובר בגרסת ניסיון מבוססת ענן בלבד, המוגבלת לקבצים בגודל של עד 100MB וסובלת לעיתים קרובות מזמני טעינה ארוכים בשל העומס על השרתים. למרות מגבלות הנגישות הנוכחיות, מדובר בצעד קריטי ומרגש במלחמה על האמת בעידן הדיגיטלי החדש.
התחבר כדי להגיב