- אנתרופיק שחררה את Claude Opus 5.5. הוא עוקף את Fable 5.1 הגדול ממנו ברוב המדדים, עולה 40% פחות לכל משימה, וקריאת מטמון זולה ב-60%. כל הבנצ'מרקים, המחירים, מה השתפר בכתיבה, ואיפה הוא עדיין מפסיד ל-GPT-6.
המספר שהכי קל לפספס בהשקה הוא לא בנצ'מרק אלא שורה בתמחור: קריאת מטמון ירדה מ-0.50 דולר למיליון טוקנים ל-0.20 דולר, ירידה של 60%. כל מי שמריץ סוכן שקורא שוב ושוב את אותו הקשר, וזה כמעט כל סוכן, מרגיש את השורה הזו יותר מכל שיפור ביכולת.
אנתרופיק שחררה היום את Claude Opus 5.5, והמספר המעניין בהשקה הזו הוא לא בנצ'מרק.
המודל החדש עוקף את Fable 5.1, המודל הגדול ממנו, כמעט בכל מדד. ועולה 40% פחות לכל משימה.
זה שובר את ההנחה שליוותה את התחום שנתיים: שגדול יותר זה חזק יותר, וששיפור עולה כסף.
מה זה Claude Opus 5.5?
Claude Opus 5.5 הוא מודל השפה החדש של אנתרופיק, הראשון במשפחת 5.5. הוא מיועד בעיקר לקידוד סוכני ולעבודת ידע, זמין במחרוזת claude-opus-5-5, ועולה 4 דולר למיליון טוקני קלט ו-20 דולר לפלט.
מה הביצועים של Opus 5.5 מול Fable 5.1 ומול GPT-6?
| מדד | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | לא פורסם |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 | 1542 |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | לא פורסם |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
| Terminal-Bench-Science | 58.7% | 52.6% | 29.0% | 64.6% |
שימו לב לשתי השורות האחרונות. GPT-6 Astra עדיין מנצח בשתיים, באוטומציה ובמדעים. מי שמספר לכם שהמודל החדש מנצח בכל פשוט לא קרא את הטבלה.
אבל ב-Terminal-Bench, המדד שבודק סוכן שעובד בטרמינל לאורך משימה ארוכה, הפער הוא 66.4% מול 57.9%. זה לא שיפור, זו קטגוריה אחרת.
כמה עולה Claude Opus 5.5?
| Opus 5.5 | Opus 5 | |
|---|---|---|
| קלט (למיליון טוקנים) | $4 | $5 |
| פלט | $20 | $25 |
| קריאת מטמון | $0.20 | $0.50 |
| כתיבה למטמון | $5 | $6.25 |
השורה שכולם יפספסו היא קריאת המטמון: ירידה של 60%.
כל סוכן שרץ בלולאה קורא שוב ושוב את אותו הקשר. מערכת ההוראות, הקבצים, ההיסטוריה. זו הוצאה שחוזרת בכל סיבוב, ורוב המשתמשים אפילו לא יודעים שהיא קיימת.
ובנוסף המודל משתמש ב-20 עד 25 אחוז פחות טוקני פלט לאותה תשובה. כלומר החיסכון מצטבר משלושה כיוונים: מחיר נמוך יותר, מטמון זול יותר, ופחות טוקנים.
מכאן מגיע ה-40% הכולל, והוא נמדד על משימה ולא על טוקן.
כמה הוא מהיר יותר?
הפלט מהיר ב-30% מ-Opus 5. ויש מצב מהיר ב-8 ו-40 דולר למיליון, שמגיע עד פי 2.5 מהמהירות הרגילה.
מה הוא עשה בפועל אצל בודקים מוקדמים?
אנתרופיק פרסמה כמה מדידות מבודקים מוקדמים, ושתיים מהן מספרות את הסיפור:
ביקורת קוד על מאגר של 200,000 שורות: פחות משלוש שעות. ל-Opus 5 לקח על אותה משימה יותר מ-20 שעות.
תרגום HAProxy מ-C ל-Rust: 9.5 שעות לעומת 12 של Fable 5.1, ובעלות נמוכה ב-51%.
ובודק אחד השלים הגירה של 680,000 שורות קוד בפחות מיום.
מה זו הכתיבה הקלודית, ומה תוקן בה?
יש תלונה ותיקה שנקראת "כתיבה קלודית": ניסוח מפותל, פורמלי מדי, ומגיע לנקודה מאוחר מדי.
אנתרופיק מצהירה על שלושה תיקונים: המידע החשוב בא ראשון, פחות ז'רגון, וציות הדוק יותר להוראות סגנון.
שווה לומר בכנות: אלה הצהרות של היצרן. גם The Decoder מציינת שאין דוגמאות לפני ואחרי ואין אימות חיצוני, ומי שכותב בעברית ידע להגיד אם זה נכון רק אחרי שבוע של שימוש.
מה מספרי הבטיחות אומרים?
זו ההשקה הראשונה של אנתרופיק מאז שקראה להאט את הקצב בחזית. לכן מספרי הבטיחות הם לא נספח, הם הטיעון.
- הציון הגבוה ביותר שהחברה מדדה אי פעם בביקורת ההתנהגות האוטומטית שלה
- חציית גבולות ב-85% פחות מקרים מ-Opus 5
- עמידות בהזרקת פרומפט משתווה או עוקפת את Opus 5 בכל הגדרה
- 72% תפיסת באגים בביקורת קוד, מול 56% של Opus 5 במאמץ גבוה
שתי הגבלות שכדאי לדעת עליהן: בנושאי סייבר המערכת מנתבת את הבקשה ל-Opus 4.8, ובנושאי ביולוגיה נדרש אישור דרך תוכנית האימות של מדעי החיים.
וטכקראנץ' מציינת, בצדק, שאימון הבטיחות עצמו "דומה במידה רבה" לקודמים, ושאין באמת אימות חיצוני עצמאי לרוב טענות הביצועים.
מה זה אומר לעסק שלכם?
שלושה דברים מעשיים.
אוטומציות שלא היו משתלמות אתמול משתלמות היום. כשעלות המשימה יורדת ב-40%, תהליכים שהיו בגבול הכדאיות עוברים אותו. שווה לחזור לרשימת ה"לא כדאי" שלכם ולחשב מחדש. אם אתם לא בטוחים מאיפה מתחילים, הסדנאות וההרצאות שאני מעביר בארגונים בנויות בדיוק סביב המיפוי הזה.
מי שמריץ סוכנים, קריאת המטמון היא הבשורה. (ואם אתם עוד לא מריצים, המדריך לעבודה עם קלוד קוד הוא המקום להתחיל בו.) ירידה של 60% בשורה שחוזרת בכל סיבוב משנה את חשבון התפעול יותר מכל שיפור ביכולת.
ואל תמהרו להחליף הכל. ב-AutomationBench, דווקא המדד שהכי רלוונטי לאוטומציה עסקית, GPT-6 Astra עדיין מוביל. הבחירה הנכונה היא עדיין לפי משימה, לא לפי כותרת.
מתי יוצאים Sonnet ו-Haiku 5.5?
Claude Sonnet 5.5 ו-Haiku 5.5 צפויים בשבועות הקרובים, עם שיפורים דומים. המודל זמין כבר עכשיו במחרוזת claude-opus-5-5, בפלטפורמה של אנתרופיק, ב-AWS, ב-Google Cloud וב-Microsoft Azure. למנויי Pro, Max ו-Team הוגדלו מגבלות השימוש בחלון חמש השעות.
בשורה התחתונה
השנתיים האחרונות לימדו אותנו שכל קפיצה ביכולת מגיעה עם קפיצה במחיר. ההשקה הזו הפוכה: יותר יכולת, פחות כסף.
ואם המגמה הזו נמשכת, השאלה בארגונים מפסיקה להיות "האם זה מצדיק את העלות" ומתחילה להיות "מה אנחנו עדיין עושים ידנית בלי סיבה".
ובנימה קשורה: אם אתם רוצים שהעסק שלכם יופיע בתשובות שמודלים כאלה נותנים ללקוחות שלכם, כתבתי על זה מדריך נפרד.
יעקב צדק, מרצה, יועץ ומטמיע AI בארגונים, ומוביל את קהילת Claude Code (קלוד קוד) הגדולה בישראל.
קורס במתנה עם ברכה אישית מכם, מסירה מיידית או בתאריך שתבחרו, וגישה לכל החיים.



