כלוב פתוח
מה קורה כשמודל בינה מלאכותית מצליח לברוח מהכלוב שלו? ג׳נסן הואנג קורא לאמץ מודלים פתוחים והצצה לראיון עם הישראלי שהיה מס׳ 2 בלינקדאין
כש״המודל ברח מהכלוב״
זה אחד הסיפורים היותר מטורפים של השנים האחרונות. איך מודל בינה מלאכותית פורץ את ״הכלוב המבודד” בו שהה, מצליח לפרוץ לאינטרנט הרחב ומשם לאתר של חברה, אחד ממאגרי המידע הכי גדולים של עולם ה-AI.
זה מה שקרה ממש השבוע במעבדות של OpenAI.
הסיפור הזה מתחיל מניסוי פנימי שעשתה מעבדת ה-AI כשבחנה את GPT-5.6 ועוד מודל חזק יותר שעדיין לא יצא לציבור. את שניהם הכניסו ל״סנדבוקס״ - מין כלוב דיגיטלי שאמור להגביל גישה לאינטרנט ולמערכות חיצוניות במטרה לבדוק יכולות סייבר בצורה ״בטוחה״. ואז הם נתנו למודלים חידה.
אלא שבמקום ״פשוט״ לפתור את המשימות, המודל המתקדם החליט פשוט לרמות. לגנוב את התשובות. המודל הבין שאת התשובה לחידה הוא יוכל למצוא באתר Hugging Face - מאגר מידע ענק של AI. אז הוא פשוט להחליט לפרוץ את ״הכלוב״ (שהיה מנותק מהרשת), מצא פרצה ויצא לאינטרנט, בשלב הבא פרץ ל-Hugging Face והשיג את התשובות.
אלא שהסיפור לא נגמר פה. ב-Hugging Face שזיהו את הפרצה הבינו מיד שלא מדובר במתקפת סייבר רגילה ״הקמפיין בוצע על ידי תשתית של סוכנים אוטונומיים, שביצעה אלפי פעולות פרטניות, הדבר תואם לתרחיש של מתקפת סוכנים״, כתבו בבלוג פוסט ששחררו רגע אחרי.
בחברה ניסו לפנות לעזרה של המודלים הגדולים (אנתרופיק ו-OpenAI), אלא שהחברות סירבו לעזור כי הם לא יודעים להבחין בין תגובה לפריצה למערכת - לבין הפריצה עצמה. אז ב-Hugging Face נאלצו לפנות למודל סיני קוד פתוח - GLM-5.2 שעלה על הפרצה וטיפל בה. שתי החברות שחררו ביחד בלוג פוסט משותף בנושא שנראה כאילו הן יותר ״חוגגות״ את האירוע מאשר מזהירות מההשלכות שלו.
Alignment - יישור, התאמה לערכים אנושיים - מושג בעולם ה-AI שמטרתו לגרום לבינה מלאכותית חזקה לרדוף אחרי מטרות בדרך שמתיישרת עם מה שאנחנו באמת רוצים, ולא רק עם הניסוח הצר של היעד שנתנו לה.
מאירוע כזה אנשי הבטיחות של עולם ה-AI מזהירים כבר שנים רבות. הרבה לפני שצ׳אט ג׳יפיטי יצא לעולם. בעצם, מה קורה כשלמערכות AI ניתנת משימה והמודל עושה כל מה שהוא יכול כדי לפתור אותה גם אם זה אומר לפעול בדרך שלא תואמת את הערכים שלנו בני האדם.
וזה לא דבר חדש - זו ״צורת עבודה״ של ממש. המודלים לאו דווקא עובדים קשה כדי להצליח לפתור משימות או בהקשר הזה להיות טובים יותר בסייבר, אלא מוצאים דרך לעקוף את כללי המשחק. Reward Hacking - אם מה שמתגמל אותם הוא ציון גבוה - אז לגנוב את פתרון הבחינה זו אסטרטגיה מצוינת בעבורם.
בבלומברג פורסמו פרטים חדשים בסוף השבוע האחרון, כך למשל שבזמן הבחינה המודלים החזקים השאירו למודלים עתידיים רמזים נסתרים איך לצאת מ״כלובים״ סגורים כאלה. בנוסף, דווח כי כבר שבוע לפני המקרה המודל ככל הנראה ניסה לצאת מהגבולות שלו, אך בחברה לא שמו לב לכך.
הסיפור הזה מעלה לא מעט שאלות לגבי עתיד ה-AI:
ב-OpenAI לא זיהו בזמן אמת כי המודלים שלהם פורצים לחברה זרה - והם הבינו את זה רק אחרי ש-Hugging Face העלתה בלוג פוסט בנושא. המעבדה הכי גדולה בעולם עושה ניסוי ולא יודעת מה קורה למודלים בזמן שהוא מתרחש?
אם מודל פנימי יכול לברוח מהכלוב שלו ולפגוע בגוף אחר ברשת, האם יש דבר כזה ״מודל פנימי״? ולמה שמודל אחר חזק לא פחות ימצא פרצות דומות בחברות תוכנה, בנק קטן או סטארטאפ בלי צוות סייבר חזק?
האם יש קו אדום ליכולות אוטונומיות - גישה לרשת, קוד, כסף - שמעליו אסור להריץ בלי רישוי ופיקוח? האם צריך ועדת בטיחות ברמת מדינה, שמקבלת גישה גם לניסויים הפנימיים של החברות?
סנקציות על המודלים הסינים? וג׳נסן למען מודלים קוד פתוח
גם שבוע אחרי, בסיליקון ואלי עדיין מורגש הזעזוע מהשקת המודל החזק Kimi K3. ממשל ארה״ב בוחן דרכים להגביל מודלי AI סיניים, כך דווח השבוע ב-Axios. בין הצעדים שנשקלים: כללי אחריות לחברות שמארחות מודלים סיניים, אזהרת אבטחה פומבית, וניתוק המעבדות הסיניות מלקוחות אמריקנים.
מי שהיה צאר ה-AI של הממשל, דיוויד סאקס, כתב שבדיוק לשם מכוונות המעבדות הסגורות מהמערב, הן רוצות שהממשלה תחסל את התחרות שמגיעה מהקוד הפתוח.
שר האוצר האמריקאי סקוט בסנט הוסיף השבוע שאם מודלים זרים גונבים IP מהחברות הגדולות של ארה״ב, לממשל ״יש את היכולת להטיל עליהם סנקציות״.
ולמה כל הלחץ פתאום? עד עכשיו כולם היו בטוחים שייקח למודלים הפתוחים מסין שנה עד שנה וחצי לסגור את הפער. אלא ש-Kimi K3 של Moonshot AI כבר ראש בראש עם Fable 5 של אנתרופיק ועם GPT-5.6 של OpenAI, ובמדד אחד של כתיבת קוד אפילו מנצח את שניהם. והוא פשוט הרבה יותר זול מהם. כתבתי על זה בהרחבה שבוע שעבר.
בינתיים בקהילת ה-AI בארה״ב גוברים הקולות לשימוש במודלים קוד פתוח. השבוע בפוסט הראשון שלו אי פעם ברשת X ג׳נסן הואנג פרסם מסמך שעליו חתומות ענקיות הטכנולוגיה מטא, מיקרוסופט, IBM, פלנטיר ועוד שורה ארוכה של ארגונים מובילים. המסמך, Open Weights and American AI Leadership, קורא לדחוף את השימוש במודלים פתוחים.
הטענה המרכזית שלו הואנג - היתרון של ארצות הברית לא ייקבע בזכות מודל אחד פורץ דרך, אלא לפי היכולת להפיץ את היכולות האלה לכל. בתי חולים, מפעלים, אוניברסיטאות, סטארטאפים ועסקים קטנים לא צריכים לאמן מודל חדש מאפס או לשלם בכל פעם על גישה למודל מתקדם יקר. הם צריכים להיות מסוגלים לקחת מודל מתקדם, להריץ אותו בעצמם, להתאים אותו לצרכים שלהם ולבנות עליו מוצרים חדשים.
השבוע אירחנו בטראשטק את ניר גזית, מייסד Traceloop שנרכשה על ידי ServiceNow, שדיבר איתנו על מודלים פתוחים ועל המודל הסיני: ״המודל הוא מודל טוב ויש פה קפיצה... אבל אנחנו לא יודעים באמת כי הם לא מפרסמים שום דבר״. מעבר לזה הוסיף גזית שחשוב להבדיל בין מודל Open-weights לבין מודל קוד פתוח: ״הם משחררים רק את המשקלים, שלא אומרים לאף אחד שום דבר״ - ולכן אין דרך לדעת על מה המודל התאמן.
אז מה בכלל עומד מאחורי האידיאולוגיה הסינית להפיץ הכל בקוד פתוח? למה להשקיע כל כך הרבה כסף ולתת את זה חינם לכולם? ״כולם שואלים את זה״, אומר לנו גזית. ״אני חושב שפשוט זה לאו דווקא אינטרס כלכלי, זה באמת כזה מין מלחמה קרה... יש פה איזשהו עניין של יוקרה. אני חושב שאם היו עושים מודלים סגורים nobody would be talking about it... ברגע שזה קוד פתוח - אנשים משתמשים בזה״.
כך או כך גזית מאמין (כמו הואנג) שהעתיד של תעשיית ה-AI הוא בקוד פתוח, צפו בפרק המלא:
איך יוצרים ויראליות בעידן ה-AI?*
עולם השיווק משתנה דרמטית בתקופת ה-AI - כמות הכלים אינסופית, הרבה יותר קשה להתבלט בפיד ותפיסת תשומת לב של אנשים הופכת להיות משימה קשה מאי פעם. בתוך כל הבלאגן הזה יש ניוזלטר אחד שמנסה לעשות לכם קצת סדר. MarketingIdeas.com של תום אורבך שולח רעיונות שיווק שכל אחד יכול ליישם בקלות לכל עסק (לא רק סטארטאפים והייטק!) - למשל איך לעשות שיווק גם בלי תקציב, מאילו חברות ענק שווה לקבל השראה לקמפיינים ועוד…
אורבך כבר 4 שנים מוביל את מחלקת ה-Growth Marketing בוויז (שנרכשה לאחרונה ע״י גוגל ב32 מיליארד דולר) ולניוזלטר שלו יותר מ-90,000 קוראים שבועיים ברחבי העולם, כולל אנשי שיווק מגוגל, מיקרוסופט, אמזון, מטא, נטפליקס, אדובי, סטרייפ, ועוד.. אז הירשמו כאן.
*בשיתוף עם MarketingIdeas
🎧 מחר בטראשטק: ראיון עם מי שהיה מספר 2 בלינקדאין, תומר כהן
הצצה מיוחדת למנויי epicNews לראיון שיעלה מחר בטראשטק עם אחד הישראלים הכי בכירים בסיליקון ואלי. תומר כהן היה סמנכ״ל המוצר הראשי של לינקדאין העולמית (יותר ממיליארד משתמשים), ועזב ממש לאחרונה אחרי 14 שנים ורכישת ענק של מיקרוסופט ב-26 מיליארד דולר. הוא סיפר לנו על הרגע שבו ראה את GPT-4 לפני כולם, על איך גרם ל-300 מנהלים בכירים להשתמש ב-AI, על הכישורים הכי חשובים היום למצוא עבודה, וכמובן: מה הסוד של האלגוריתם של לינקדאין? פה הוא מספר על הקטע שראה לראשונה את GPT-4, לפני שאנחנו קיבלנו גישה לצ׳אט ג׳יפיטי, הראיון יעלה מחר בבוקר באפליקציות הפודקאסטים (ספוטיפיי, אפל), ואחה״צ ביוטיוב:
נהנתם? עדיין לא נרשמתם? לחצו על הכפתור 👇ותקבלו את הניוזלטר למייל בכל שבת:
עוד כותרות מהשבוע האחרון:
אפל תשכיר לכם אייפון? אפל מתכננת להשיק תכנית שדרוג לאייפונים שלה בשילוב Klarna; משלמים תשלומים קבועים והחברה תשדרג לכם את המכשיר
אנת׳רופיק השיקה השבוע את Record a Skill: מקליטים את המסך תוך כדי ביצוע משימה ומדברים בקול על מה שעושים. קלוד מקבל את הקלטת המסך, הקלקות העכבר, ההקלדות והקריינות שלכם - והופך את זה לסקיל מובנה שאפשר להריץ שוב ושוב. במקום פרומפט הנדסי מפורט, פשוט מדגימים




