המודל שברח מהמעבדה בכדי לרמות במבחן 😱

המודל שברח מהמעבדה בכדי לרמות במבחן 😱

הי חברים, תקשיבו לסיפור המטורף הזה, כי בעיניי הוא נותן הצצה די מדהימה למה שמחכה לנו עם הדור הבא של מודלי ה-AI.

חברת OpenAI רצתה לבדוק עד כמה אחד המודלים החדשים שלה טוב בסייבר, אז הכניסו אותו לסביבה מבודדת, בלי גישה רגילה לאינטרנט, ונתנו לו מטרה: להשיג את הציון הכי גבוה שאפשר במבחן סייבר.אז מה המודל עשה? הוא החליט לרמות. 😳 ולא מדובר בלחפש תשובה בגוגל.

המודל התחיל לחפש דרך לצאת מהסביבה המבודדת, זיהה חולשות במערכות, ובשלב מסוים אפילו מצא וניצל פרצת Zero-Day.
למי שלא מכיר, Zero-Day היא פרצת אבטחה שאפילו החברה שפיתחה את התוכנה עדיין לא יודעת שקיימת, ולכן גם אין לה עדיין תיקון.

אחרי שהצליח להגיע לאינטרנט, הוא הגיע ל-Hugging Face, אחת הפלטפורמות המרכזיות בעולם ה-AI, שבה משתפים מודלים, מאגרי מידע וכלי AI.
המודל הבין שייתכן שנמצאים שם נתונים הקשורים למבחן שלו, ובאמצעות שילוב של כמה פרצות ופרטי גישה שנגנבו, ניסה להגיע לתשובות.

וזה החלק שהכי מעניין:
אף אחד לא אמר לו ״תפרוץ ל-Hugging Face״.
אף אחד לא אמר לו ״תחפש Zero-Day״.
אף אחד אפילו לא אמר לו ״תרמה במבחן״.
אמרו לו רק: תשיג את הציון הכי גבוה שאתה יכול. והוא בנה לבד את כל הדרך לשם.

לפי OpenAI, באירוע היו מעורבים GPT-5.6 Sol ומודל נוסף, מתקדם יותר, שעדיין לא שוחרר.OpenAI לא אמרה איזה מודל זה, אבל לדעתי אנחנו מדברים כאן על GPT-6.

ואם זה באמת GPT-6, זאת הצצה מאוד מעניינת למה שעומד להגיע כי הסיפור החשוב פה הוא לא שה-AI ״הפך לרע״.
הסיפור הוא שמודלים הופכים להיות מספיק חכמים ועצמאיים כדי למצוא דרכים שאנחנו בכלל לא חשבנו עליהן להשגת המטרה שנתנו להם.

והחלק המפחיד באמת? המודלים האלה רק הולכים ונהיים טובים יותר.

חומר למחשבה לסופ״ש 🙂