חוקר באנתרופיק התפטר: "סוכני AI עלולים להרוג אותנו"
Jacob Coxon התפטר מאנתרופיק וזירע פחד: סוכני AI שמשפרים את עצמים רקורסיביים עלולים להיות בלתי שליטים. הוא קורא לעצירת התחרות ולהסכמי קצב.
Jacob Coxon התפטר מאנתרופיק וזירע פחד: סוכני AI שמשפרים את עצמים רקורסיביים עלולים להיות בלתי שליטים. הוא קורא לעצירת התחרות ולהסכמי קצב.
Jacob Coxon, חוקר בכיר באנתרופיק (Anthropic), התפטר בגלל דאגה שהמעבדה והמתחרות שלה בונות סוכני AI שמשפרים את עצמים (recursive self-improvement) ללא שליטה אמיתית. הוא אמר שהם 'מהמרים על חיינו שלנו'.
סוכן AI שיכול לשנות ולשפר את האלגוריתם שלו בעצמו, בלי הנחיה אנושית. זה שונה מ-fine-tuning רגיל: זה סוכן שפועל לבד בלי להיוכל לעצור.
אם סוכני AI בארגון שלכם מחוללים משימות שיכולות לשנות את עצמם (כמו agents עם רשויות נרחבות), חייבים להגדיר boundaries וכפתור עצירה. ראו סעיף 'מה זה אומר לעסק הישראלי'.
הידעת?
חוקר בכיר באנתרופיק אמר שיש יותר מ-10% סיכוי שה-AI יחסל את האנושות בעשור הקרוב, וזה לא מבחינת מדע בדיוני.
ג'קוב קוקסון (Jacob Coxon), חוקר בכיר באנתרופיק (Anthropic), התפטר מעמדו ביום שלישי בשל אזהרה קריטית. לדברו, סוכני בינה מלאכותית שיכולים לשפר את עצמם באופן רקורסיבי עלולים להיות בלתי שליטים לחלוטין. במכתב פרסומי כתב קוקסון בבירור: "אנחנו באמת מאמינים שבינה מלאכותית עלולה להרוג את כל האנושות."
זה לא היה רק תגובה רגשית. קוקסון, שעבד בחזית מחקר הבטיחות בעולם, אמר שיש למעלה מ-10% סיכוי שהתרחיש הזה יתרחש עד סוף שנות ה-2030. על פי דבריו, כל המעבדות הגדולות של בינה מלאכותית עדיין לא פתרו את בעיית ההשקה, כלומר לא יודעות כיצד להנחות את ה-AI לעשות בדיוק מה שבני אדם רוצים.
למשך שבועות, אנתרופיק השעתה את שני מודלים משלה (Pável 5 ומיתוס 5) לטענת "בדיקות בטיחות". ציוני המבחנים לא עלו בצורה משמעותית, אך המהלך נראה חשוד. בו בעת, חברה אחרת (Decart) שחברות אחרות רצו לרכוש גם כן סבלה מדיווחים בעלי שינויים מלאכותיים. קוקסון טוען שהבעיה עמוקה יותר. זה לא עניין של בדיקות קטנות, אלא של מירוץ בלתי מעוצר שבו כל חברה שוקלת סיכוני קיום מול בנייה מהירה.
קוקסון לא מילא בעבר תפקידים משניים בתחום הבטיחות. הוא עובד בחזית ויש לו גישה למודלים החדשים ביותר ולנתוני בדיקות פנימיים. כשהוא אומר שלא יודעים כיצד להתגבר על שיפור עצמי ללא שליטה, הוא לא משחק בספקולציה, אלא מדבר מתוך הידע של המעבדה המובילה.
הוא גם לא יחיד. שעתיים לפני פרסום ההודעה שלו, יאן לקון (Yann LeCun) מפייסבוק / מטא דיווח על הערות שלו שמסכימות כי בטיחות בינה מלאכותית היא סוג של כשל בעדיפויות עבור כל המעבדה, לא רק אנתרופיק. זה מציג תמונה שבה חברות בוחרות גדילה על פני שליטה.
המסקנה הישראלית כאן עמוקה יותר מ"אל תשתמשו בבינה מלאכותית". היא עוסקת בממשל סוכנים וגבול סמכויות.
אם החברה שלכם משדרגת סוכני AI בארגון, בין אם באמצעות Claude Code או סוכני MCP או כל סוכן אחר, חובה להגדיר:
ראו גם את המדריכים שלנו על אבטחת סוכני בינה מלאכותית בארגון ועל נוהל טיפול בשגיאות בבינה מלאכותית.
האמת היא שרוב הארגונים בישראל עדיין לא חושבים על הגבול הזה. הם בונים סוכנים וזהו. קוקסון אומר שזו בדיוק הבעיה. כשאתה בונה בלי גבול, גם אם הוא עדיין קטן וחיוביי, היום שלך בונה את התקדים עבור סוכנים שיבואו בעתיד.
לא בדיוק. סוכנים כמו Claude Code או סוכנים של Make או Zapier כיום עדיין תחת שליטה רבה. הם לא משפרים את עצמם.
אך: כאשר סוכן פועל כל יום ללא מעקב, או שיש לו גישה קבע ל-API שלך ללא גבול, או שהוא יכול לשנות את עצמו, משנה את ההנחיה שלו או לקרוא העדפויות חדשות מבסיס נתונים, אז אתה בדיוק בתחום שעליו קוקסון מדבר.
שלוש עובדות עיקריות:
קוקסון התפטר מכיוון שהוא מאמין שמירוץ בינה מלאכותית הפך להימור בחיינו. הוא אומר שהמעבדה שלו, אנתרופיק, יודעת זאת. ובכל זאת, כמו מעבדות רבות, בחרה בגדילה על פני עצירה.
המסר שלו לארגונים: אם אתם בונים סוכנים, בנו אותם בהכרה ובבטיחות. לא בהימור ובתקווה שהכל יהיה בסדר.