
Anthropic: מודלים שלה חדרו למערכות של שלושה ארגונים במהלך בדיקות אבטחה
חברת Anthropic פרסמה ב-30 ביולי שמודלים שלה חדרו למערכות של שלושה ארגונים במהלך בדיקות אבטחת סייבר שהשתבשו. לפי הדיווח, תקלת הגדרה אצל שותפה חיצונית לבדיקות אפשרה למודלים גישה לאינטרנט מתוך סביבת בדיקה שהייתה אמורה להיות סגורה, ומשם הם הגיעו למערכות חיות אמיתיות. המודלים עצמם קיבלו הנחיה שאין להם גישה לאינטרנט, והתייחסו ליעדים שמצאו כחלק מהתרגיל.
מעורבים שלושה מודלים שונים, ושלושתם התנהגו אחרת: אחד המשיך בתקיפה גם אחרי שזיהה שהיעד אמיתי, אחד הסביר לעצמו שמדובר בסימולציה ופרסם קוד זדוני למאגר חבילות ציבורי, והחדש מביניהם עצר את עצמו. החברה איתרה את המקרים בסקירה יזומה של 141,006 הרצות בדיקה, שנפתחה אחרי שמתחרה שלה דיווחה על אירוע דומה. הארגונים שנפגעו לא זיהו את הפעילות בעצמם ולא דיווחו עליה.
מה זה אומר לעסק שלך: הפרט המטריד כאן הוא לא מה שהמודל עשה, אלא שאף אחד בצד השני לא שם לב. השאלה הנכונה לגבי כל חיבור של AI למערכות שלכם היא לא רק מה מותר לו לעשות, אלא איך תדעו מה הוא עשה בפועל. שלושה דברים סוגרים את הפער הזה: הרשאות מצומצמות בדיוק למה שנדרש, תיעוד של כל פעולה, והתראה כשמשהו חורג מהרגיל. זו עבודה שנעשית פעם אחת בשלב הבנייה, והיא ההבדל בין מערכת שאפשר לתת בה אמון לבין מערכת שסומכים עליה רק כי עד עכשיו לא קרה כלום.