ג'מיני 3.8 פלאש (Gemini 3.8 Flash): המחיר לטוקן לא עלה, אבל חשבון ה-AI שלכם עלול לגדול [2026]
המודל השלישי במשפחת פלאש בתוך כשישה שבועות: מיליון טוקנים בקלט, מהירות פלט שיא של כ-305 טוקנים לשנייה, ומחיר שלא השתנה. רק שהמחיר הזה בתוקף עד סוף 2026, ואז הוא מוכפל. פירקתי את ההכרזה לעובדות, והוספתי את הסעיף שהכי חסר בסיקור: איך מחשבים עלות למשימה ולא לטוקן.

הידעת?
ג'מיני 3.8 פלאש הוא דגם הפלאש השלישי שגוגל משחררת בתוך כשישה שבועות בלבד. ובמדידה של Artificial Analysis הוא הציג מהירות פלט של כ-305 טוקנים לשנייה, המהירה ביותר שנמדדה שם אי פעם. גוגל כבר לא עובדת בעדכוני ענק שנתיים, אלא בשיפור כמעט רציף.
גוגל דיפמיינד (Google DeepMind) שחררה ב-2.9.2026 את ג'מיני 3.8 פלאש (Gemini 3.8 Flash), מודל חדש שמיועד לקוד, לסוכנים אוטונומיים ולמשימות ארוכות טווח. רוב הסיקור מתמקד במהירות ובמדדים, אבל השורה הכי חשובה בהכרזה היא דווקא שורת תמחור קטנה שרוב העסקים יפספסו.
בקצרה: המחיר לטוקן לא השתנה: 0.75 דולר למיליון טוקני קלט, 3.75 דולר למיליון טוקני פלט. אבל התמחור הזה בתוקף רק עד 31.12.2026, ומ-1.1.2027 שני התעריפים מוכפלים. ובנפרד מזה, מודלי חשיבה נוטים לצרוך יותר טוקני פלט למשימה. כלומר: גם בלי שהמחיר לטוקן זז, חשבון ה-AI שלכם יכול לגדול.
מה בדיוק שוחרר?
ג'מיני 3.8 פלאש הוא מודל מהיר שמכוון לעבודה סוכנית: קוד, אוטומציות ומשימות שנמשכות לאורך זמן. לפי דף המודל הרשמי של גוגל, הוא מגיע עם חלון הקשר של מיליון טוקנים, עד 64 אלף טוקנים בפלט, ותמיכה בכלים מובנים.
התוספת המעניינת היא רמות חשיבה מתכווננות: low, medium ו-high. אתם בוחרים כמה "לחשוב" המודל ישקיע במשימה, וזה בדיוק המקום שבו נפגשים ביצועים ועלות, ותכף נגיע לזה.
הנה הנתונים המרכזיים במבט אחד:
| מאפיין | ג'מיני 3.8 פלאש |
|---|---|
| חלון הקשר | מיליון טוקנים |
| פלט מקסימלי | עד 64 אלף טוקנים |
| רמות חשיבה | low / medium / high |
| כלים מובנים | נתמכים |
| מהירות פלט | כ-305 טוקנים לשנייה (מדידת Artificial Analysis) |
| קלט | 0.75 דולר למיליון טוקנים (עד 31.12.2026) |
| פלט | 3.75 דולר למיליון טוקנים (עד 31.12.2026) |
בצד המדדים, גוגל מדווחת על שיפור של כ-6 נקודות במדדי קוד ארוך-טווח לעומת הדור הקודם. ומהירות הפלט שנמדדה, כ-305 טוקנים לשנייה, היא המהירה ביותר שנמדדה על ידי Artificial Analysis. במשימות סוכניות, שבהן כל צעד מחכה לצעד הקודם, מהירות כזו מצטברת לחיסכון זמן אמיתי לאורך תהליך שלם.
כמה זה עולה? הנה השורה שכולם מפספסים
התעריף נשאר זהה ל-3.7 פלאש: 0.75 דולר למיליון טוקני קלט ו-3.75 דולר למיליון טוקני פלט. אבל המחירים האלה בתוקף רק עד 31 בדצמבר 2026. מ-1 בינואר 2027 שני התעריפים מוכפלים: 1.50 דולר לקלט ו-7.50 דולר לפלט למיליון טוקנים.
זה מהלך שכדאי לקרוא נכון. גוגל בעצם נותנת לשוק רבעון של תמחור היכרות, ומי שבונה עכשיו מערכת שלמה סביב חישוב עלויות של ספטמבר, יגלה בינואר שחשבון ה-API שלו הוכפל בלי שינה שורת קוד אחת.
למי שמנהל תקציב AI זו נקודת החלטה קונקרטית: כל תחזית עלויות ל-2027 שמבוססת על התעריף הנוכחי פשוט שגויה. תכננו מראש, או שתופתעו בחשבונית של ינואר.
בואו נמחיש עם דוגמה מספרית פשוטה. נניח סוכן שמעבד פנייה עם 20 אלף טוקני קלט ו-4,000 טוקני פלט: היום זה בערך 3 סנט לפנייה, כלומר כ-300 דולר על 10,000 פניות בחודש. אותו עומס בדיוק, בינואר 2027, כבר עולה כ-600 דולר. שום דבר לא השתנה בקוד, בפרומפטים או בשימוש, רק בתאריך.
למה משימה יכולה להתייקר גם כשהמחיר לטוקן קבוע?
כי במודלי חשיבה (Reasoning) אתם משלמים לא רק על התשובה, אלא גם על הדרך אליה. צעדי החשיבה של המודל נספרים כטוקני פלט לכל דבר, וטוקני פלט הם החלק היקר בתמחור.
זה עיקרון כללי של דור המודלים הנוכחי, לא משהו ייחודי לגוגל: כשמודל "חושב" יותר כדי להגיע לתוצאה טובה יותר, הוא צורך יותר טוקנים לאותה משימה בדיוק. התוצאה יכולה להיות מוזרה למי שמסתכל רק על מחירון: מודל חדש באותו מחיר לטוקן, וחשבון חודשי גבוה יותר.
לכן רמות החשיבה המתכווננות של 3.8 פלאש הן לא פיצ'ר נחמד, הן כלי ניהול עלויות. משימת שגרה ברמת low, החלטה מורכבת ברמת high, ולא הכול על המקסימום כברירת מחדל.
וזה מתחבר לנקודה הראשונה: אם המשימות שלכם יצרכו יותר טוקני פלט בגלל חשיבה, ובינואר טוקן הפלט גם מתייקר פי שניים, שני האפקטים מכפילים זה את זה. מי שלא מודד את שניהם עכשיו, יתקשה להסביר את החשבונית בעוד חצי שנה.
מה מלמד הקצב של גוגל?
זה דגם הפלאש השלישי בתוך כשישה שבועות בערך. גוגל עברה ממודל של השקות ענק פעם בשנה לשיפור כמעט רציף, גרסה אחרי גרסה, בקצב שמזכיר עדכוני תוכנה רגילים יותר מאשר הכרזות מודלים.
למשתמשים זה מצוין: שיפורים מגיעים מהר. לעסקים זה אומר משהו נוסף: אי אפשר יותר לקבע החלטת "המודל שלנו" אחת לשנה. תשתית ה-AI הארגונית צריכה להיות בנויה להחלפת מודלים, עם מדידה שוטפת של עלות מול תועלת, כי הנוף משתנה כל כמה שבועות.
וזה לא רק גוגל. גם אנתרופיק שחררה את פייבל 5.1 פחות משלושה חודשים אחרי פייבל 5, ואותו דפוס חוזר אצל כל הספקים הגדולים. הדור הזה של מודלים מתעדכן בקצב של אפליקציה, לא בקצב של גרסת תוכנה ארגונית.
ג'מיני פלאש מול קלוד: מי מתאים למה?
התשובה הקצרה: לכל מודל המקום שלו, ומי שמנסה להכתיר "מנצח" אחד פשוט שואל שאלה לא נכונה.
פלאש בנוי לנפח ולמהירות: סיווג פניות, עיבוד מסמכים בכמויות, סוכנים שמריצים הרבה צעדים קטנים וזולים. כשהמשימה חוזרת על עצמה אלפי פעמים ביום, מהירות של כ-305 טוקנים לשנייה ותעריף נמוך הם בדיוק מה שצריך.
מודלים כבדים כמו קלוד פייבל 5.1 (Claude Fable 5.1) משחקים במגרש אחר: משימות שבהן טעות עולה כסף אמיתי, קוד מורכב, ניתוח שדורש עומק, עבודה סוכנית ארוכה שצריכה להחזיק הקשר ושיקול דעת. שם משלמים יותר לטוקן, ומרוויחים פחות תיקונים אחרי המכונה.
הפרקטיקה שאנחנו רואים אצל ארגונים בוגרים היא ניתוב: כל סוג משימה מקבל את המודל הזול ביותר שעומד ברף האיכות שלה. זו לא בחירת ספק, זו ארכיטקטורה.
דוגמה מהשטח: מערכת שירות לקוחות יכולה לסווג ולתייג כל פנייה נכנסת עם מודל מהיר וזול, ולהעביר רק את המקרים הרגישים, תלונה משפטית, לקוח גדול שמאיים לעזוב, למודל הכבד. כך 90% מהנפח רץ בעלות מינימלית, וה-10% שבאמת חשובים מקבלים את שיקול הדעת הטוב ביותר שיש. שני המודלים מנצחים, כי כל אחד עושה את מה שהוא בנוי לעשות.
איך בודקים מה מודל באמת עולה לכם?
המדד היחיד שמעניין עסק הוא עלות למשימה, לא מחיר לטוקן. הנה תהליך בדיקה שאפשר להריץ השבוע:
- הגדירו משימה מייצגת. לא בנצ'מרק כללי, אלא המשימה שלכם: סיכום שיחת מכירה, טיוטת מייל, ניתוח מסמך. הריצו אותה 20-30 פעמים על נתונים אמיתיים.
- מדדו צריכה בפועל. כל ספקי ה-API מחזירים בכל תשובה את מספר טוקני הקלט והפלט שנצרכו, כולל טוקני חשיבה. אל תעריכו, תמדדו. הכפילו בתעריף וקיבלתם עלות אמיתית למשימה.
- קבעו תקרות והתראות. תקציב חודשי ברמת המפתח או הפרויקט, והתראה כשחוצים אחוז מוגדר ממנו. הפתעות בחשבונית הן תמיד תוצאה של מדידה שלא הייתה.
- בדקו מחדש בכל החלפת מודל ובכל שינוי תעריף. משימה שעלתה אגורות במודל אחד יכולה לעלות פי כמה במודל חושב, וההכפלה של ינואר 2027 היא תזכורת שגם המחירון עצמו הוא משתנה, לא קבוע.
ומתי פלאש מספיק? כשהמשימה מובנית, חוזרת ובעלת רף טעות סלחני. מתי צריך מודל כבד? כשהפלט מגיע ללקוח, לחוזה או להחלטה ניהולית בלי בן אדם באמצע. הכלל המעשי: תתחילו מהמודל הזול, תעלו רמה רק איפה שהאיכות נופלת מתחת לרף.
ומה זה אומר לעסק שלכם?
שלוש שורות תחתונות:
- אם אתם על ג'מיני, סמנו ביומן את ה-1.1.2027. תחזית העלויות שלכם ל-2027 צריכה להיבנות כבר עכשיו על התעריף הכפול, לא על תעריף ההיכרות.
- תפסיקו להשוות מחירונים, תתחילו למדוד משימות. מחיר לטוקן הוא מספר שיווקי. עלות למשימה, כולל טוקני חשיבה, היא המספר שמופיע בחשבונית.
- תבנו לניוד, לא לנאמנות. שלושה דגמי פלאש בשישה שבועות אומרים שהשוק זז מהר. ארכיטקטורה שמאפשרת החלפת מודל בקלות שווה יותר מכל הנחה זמנית.
מי שרוצה לבנות את המדידה והניתוב האלה על המערכות של הארגון שלו, ולא בתיאוריה: סדנת AI מעשית לארגון, שם אנחנו עוברים עם הצוות שלכם על העומסים האמיתיים ובוחרים מודל לכל משימה. וליחידים שרוצים ליווי אישי בבניית תהליך כזה, יש שיעור פרטי אחד על אחד שבו עושים את זה על הפרויקט שלכם.
מקורות: דף המודל הרשמי, Google AI for Developers · ניתוח התמחור של eesel AI · מדידות המהירות של Artificial Analysis
קורס במתנה עם ברכה אישית מכם — מסירה מיידית או בתאריך שתבחרו, וגישה לכל החיים.


