עלויות ומחירי LLM ב-2026
כמה באמת עולה כל מודל? השוואת מחירים מלאה של GPT-5, Claude, Gemini ו-Grok — מחיר לכל מיליון טוקנים, איזה מודל משתלם לכל משימה, ואיך לחתוך את החשבון.
איך מתמחרים LLM — הבסיס
מודלי שפה מתמחרים לפי טוקנים (בערך 3–4 תווים למילה באנגלית; בעברית קצת יותר). המחיר מחולק ל-input (מה ששולחים למודל — הפרומפט וההקשר) ו-output (מה שהמודל מייצר). Output כמעט תמיד יקר יותר. המחירים בטבלה הם ל-מיליון טוקנים ($ / 1M).
שיחת צ'אט ממוצעת ≈ 1K–3K טוקנים. מיליון טוקנים ≈ מאות שיחות. לכן מודל ב-$1/1M input עולה שברי סנט לשיחה — עד שמגיעים לנפח גבוה, ואז ההבדלים מצטברים לכסף אמיתי.
טבלת מחירים — אוגוסט 2026
מחיר לכל 1M טוקנים (input / output). מספרים לפי מחירוני ה-API הרשמיים נכון לאוגוסט 2026:
| ספק | מודל | Input | Output | מתאים ל- |
|---|---|---|---|---|
| OpenAI | GPT-5.6 Sol | $4.00 | $20.00 | reasoning, קוד ו-agents כבדים |
| GPT-5.6 Terra | $2.00 | $12.00 | עבודה יומיומית מאוזנת | |
| GPT-5.6 Luna | $0.20 | $1.20 | volume גבוה, עלות מינימלית | |
| GPT-5 (מקורי) | $0.625 | $5.00 | reasoning חסכוני | |
| Anthropic | Claude Opus 5 | $5.00 | $25.00 | קוד מורכב, סוכנים ארוכי-טווח |
| Claude Sonnet 5 | $2.00 | $10.00 | מאוזן — ברירת מחדל מצוינת | |
| Claude Haiku 4.5 | $1.00 | $5.00 | מהיר וזול, נפח גבוה | |
| Gemini 3 Pro | $2.00 | $12.00 | context ארוך, ניתוח מסמכים | |
| Gemini 3.7 Flash | $0.75 | $3.75 | workhorse מהיר וזול | |
| Gemini 3.5 Flash-Lite | ~$0.10 | ~$0.40 | סיווג, נפח ענק, latency נמוך | |
| xAI | Grok 4.6 | $2.00 | $6.00 | agents, קוד, X בזמן אמת |
| Grok 4.5 | $2.00 | $6.00 | דור קודם, cached זול יותר |
מחירי LLM משתנים תדיר. חלק מהמודלים גובים תעריף גבוה יותר על context מעל סף מסוים (למשל Grok מעל 200K, ו-Gemini Flash צפוי לעלות ב-2027). תמיד ודא במחירון הרשמי לפני חישוב תקציב.
איך בכלל מתמחרים — ומה נספר
לפני המספרים, שווה לדעת מה בדיוק נמדד, כי כאן נמצא רוב הבלבול.
הכול נמדד בטוקנים, לא במילים ולא בתווים. טוקן הוא פיסת טקסט — לעתים מילה שלמה, לעתים חלק ממילה. באנגלית, מילה ממוצעת היא בערך טוקן ורבע. בעברית היחס גרוע יותר, כי המפרקים אומנו בעיקר על אנגלית ומילה עברית מתפצלת לכמה חלקים.
ההשלכה המעשית שאי אפשר לעקוף: אותו מסמך בעברית עולה יותר מאותו מסמך באנגלית, וגם תופס יותר מחלון ההקשר. זה לא פער דרמטי וזה מספיק כדי לשבש תקציב שחושב לפי מילים.
ושתי הבחנות שחוזרות בכל דף תמחור:
- כניסה מול יציאה. מה ששלחתם מול מה שחזר. היציאה יקרה פי כמה לטוקן — ובכל זאת, כפי שנראה בהמשך, הכניסה היא לרוב רוב החשבון, פשוט כי היא גדולה בהרבה.
- מחיר לכל מיליון טוקנים. כל המספרים בטבלה הם ליחידה הזו. זה נשמע הרבה, ומערכת בייצור מגיעה לשם מהר.
ומה שלא נכלל במחיר לטוקן: אחסון של מסמכים, מסד נתונים וקטורי, הרצת השרתים שלכם, וזמן אדם. בפרויקטים קטנים עלות המודל היא לרוב לא הסעיף הגדול — וזה שיקול שכדאי לזכור לפני שמשקיעים שבוע באופטימיזציה שתחסוך עשרה דולר בחודש.
לחשב כמה זה יעלה לכם — לפני שמריצים
הטבלה למעלה נותנת מחיר לטוקן. מה שאף טבלה לא תיתן הוא כמה טוקנים אתם באמת צורכים, וזה המספר שקובע את החשבון.
שלושה כללי אצבע שמקרבים מספיק כדי להחליט:
- הכניסה עולה יותר מהיציאה. לא לטוקן — בסך הכול. תשובה בת מאתיים מילים יושבת על הקשר של אלפי טוקנים. מכאן שקיצור התשובה כמעט לא משפיע, וצמצום ההקשר משפיע ישירות.
- בעברית המספר גבוה יותר. אותו תוכן נשבר ליותר טוקנים מאשר באנגלית, ולכן הערכה שנעשתה לפי ספירת מילים תצא נמוכה מדי. זה לא זניח, וזה מה שהופך חישוב לפי טבלה אמריקאית למטעה.
- מה שחוזר בכל קריאה נספר בכל קריאה. הנחיית המערכת, הגדרות הכלים והדוגמאות — כולם נשלחים מחדש בכל פעם.
והדרך היחידה שלא מנחשת:
# אומדן חודשי, על התוכן שלכם
in_tok = 3_000 # הקשר טיפוסי לקריאה
out_tok = 300
calls = 5_000 # קריאות בחודש
price_in, price_out = 2.00, 10.00 # לכל מיליון טוקנים
cost = (in_tok * calls / 1e6) * price_in \
+ (out_tok * calls / 1e6) * price_out
print(round(cost, 2), "$ לחודש")
# ואז החלק שמפתיע: כפלו במספר הניסיונות החוזרים
# ובמספר השלבים אם זו מערכת רב-שלבית.
שתי השורות האחרונות הן בדרך כלל ההפרש בין ההערכה למציאות. מערכת עם שלושה שלבים היא שלוש קריאות, לא אחת, וקריאה שנכשלת ורצה שוב נספרת פעמיים בחשבון ופעם אחת בלוג.
איזה מודל לאיזו משימה
- נפח עצום / סיווג / חילוץ פשוט: Gemini 3.5 Flash-Lite או GPT-5.6 Luna — שברי סנט לכל קריאה
- צ'אטבוט / עבודה יומיומית: Gemini 3.7 Flash, Claude Haiku 4.5 או GPT-5.6 Terra — איזון מחיר/איכות
- קוד ו-reasoning מורכב: Claude Opus 5, GPT-5.6 Sol או Grok 4.6
- context ארוך מאוד (מסמכים/codebase): Gemini 3 Pro
- מידע בזמן אמת מ-X: Grok 4.6
- עברית איכותית: GPT-5 ו-Claude מובילים; Gemini קרוב
לא חייבים מודל אחד. נתב משימות פשוטות למודל זול (Haiku/Flash/Luna) ורק את המורכבות למודל היקר. זה לבד יכול לחתוך 50–80% מהעלות בלי לפגוע באיכות.
מה שהטבלה לא מראה
מחיר לטוקן הוא שורה אחת בחשבון. ארבעה דברים נוספים משפיעים עליו לא פחות, ואף אחד מהם לא מופיע בהשוואות:
- מטמון על ההקשר. רוב הספקים מציעים הנחה משמעותית על חלק מההקשר שחוזר על עצמו. במערכת עם הנחיית מערכת ארוכה זה ההבדל הגדול ביותר בחשבון — גדול מהפער בין שני מודלים. התנאי: מה שקבוע בפתיחה, מה שמשתנה בסוף.
- עיבוד באצווה. מי שלא צריך תשובה מיד — דוחות, סיווג רטרואקטיבי, עיבוד ארכיון — מקבל הנחה ניכרת, לרוב כמחצית. זה כסף שמושאר על השולחן בכמעט כל מערכת.
- מודלים שחושבים. מודל שמייצר שרשרת חשיבה לפני התשובה מחייב גם על החשיבה. התשובה נראית קצרה והחשבון לא.
- תמונות ואודיו. נספרים כטוקנים, ביד רחבה. מערכת שמעבדת צילומי מסך או מסמכים סרוקים מתנהגת אחרת לגמרי ממערכת טקסט.
ויש כאן פרט שכדאי לשים לב אליו במיוחד בטבלה עצמה: חלק מהמחירים הם מבצעי השקה עם תאריך סיום. מחיר שנראה זול היום עשוי לעלות בתאריך ידוע מראש — למשל, התמחור המוזל של דגמי Flash מוגדר עד סוף 2026. מערכת שנבנתה על מחיר מבצע צריכה לדעת מתי הוא נגמר.
איך חוסכים — 4 מנופים גדולים
- Prompt Caching: הקשר קבוע שחוזר (system prompt, מסמכים) נשמר ב-cache — הנחה של עד ~90% על ה-input הזה
- Batch API: עיבוד לא-דחוף (עד 24 שעות) ב-50% הנחה אצל רוב הספקים
- Model Routing: המודל הזול למשימות הקלות, היקר רק לקשות
- הידוק פרומפטים: פחות טוקני input, הגדרת
max_tokensמדויקת — כל טוקן מיותר עולה כסף
למדריך מלא עם דוגמאות קוד לכל טכניקה — הוזלת עלויות LLM.
לא מודל אחד — מודל לכל שלב
ההחלטה "באיזה מודל להשתמש" נעשית לרוב פעם אחת בתחילת הפרויקט, ואז לא נבדקת שוב. זו ההחמצה הגדולה ביותר בתחום, כי ברוב המערכות לא כל השלבים צריכים את אותו מודל.
מערכת טיפוסית מכילה שלושה סוגי שלבים, ורק אחד מהם דורש מודל חזק:
- סיווג וניתוב. "על מה השאלה הזו" — משימה קלה. מודל זול מבצע אותה כמעט באותה איכות, בעשירית המחיר ובשבריר מהזמן.
- חילוץ שדות. להוציא תאריך, סכום ומזהה מטקסט. גם כאן מודל קטן מספיק, במיוחד עם סכמה שמכריחה מבנה.
- ניסוח או שיקול דעת. התשובה שהמשתמש קורא, או החלטה שדורשת נימוק. כאן, ורק כאן, המודל החזק מצדיק את עצמו.
המשמעות בחשבון גדולה: מערכת שמריצה את המודל היקר על כל חמשת השלבים משלמת פי כמה על ארבעה שלבים שלא היו צריכים אותו. ירידה מודל אחד בשניים-שלושה שלבים היא בדרך כלל החיסכון הגדול ביותר שאפשר לעשות בלי לגעת באיכות.
והדרך להחליט אינה תחושה אלא בדיקה: להריץ את אותם עשרים מקרים על שני המודלים ולראות אם ההפרש מצדיק את הפער במחיר. לעתים קרובות מתברר שלא — וזו בדיוק המדידה שמפרטת בEvals.
איך להשוות ספקים בלי ליפול למלכודות
השוואת מחיר לטוקן בין שני ספקים היא השוואה חלקית, ולעתים מטעה. ארבעה גורמים שהופכים את "הזול יותר" ליקר יותר בפועל:
- כמה טוקנים הם סופרים על אותו טקסט. מפרקים שונים מפצלים אחרת, וההבדל מורגש במיוחד בעברית. מודל שנראה זול ב-20% יכול לספור 15% יותר טוקנים ולסגור את הפער.
- כמה המודל מפטפט. מודל שנוטה לתשובות ארוכות עולה יותר על אותה משימה, בלי קשר למחיר הנקוב. הנחיה שמבקשת תמציתיות היא גם אופטימיזציה כלכלית.
- כמה ניסיונות חוזרים. מודל זול שנכשל בסכמה אחת מכל חמש קריאות ורץ שוב הוא מודל שמחירו האפקטיבי גבוה ב-20%.
- מה קורה בהקשר ארוך. חלק מהספקים מתמחרים מדרגה גבוהה יותר מעל אורך מסוים. מערכת עם מסמכים ארוכים עשויה לרוץ כולה במדרגה היקרה בלי שאיש שם לב.
ולכן ההשוואה היחידה ששווה משהו היא להריץ את אותו מערך מקרים אמיתי על שני הספקים ולמדוד את העלות בפועל — לא לחשב מהטבלה. זה לוקח שעה, וזה גם בדיוק המערך שתצטרכו ממילא כדי לדעת אם האיכות מספיקה.
לא רוצים לשלם בכלל? הריצו מקומית (חינם)
אפשר להריץ מודלי שפה מקומית על המחשב שלך — בחינם לגמרי, בלי API ובלי חשבון. המידע גם נשאר אצלך (פרטיות מלאה), וזה עובד גם בלי אינטרנט. המחיר: צריך חומרה סבירה (במיוחד RAM/GPU), והמודלים הפתוחים בדרך כלל חלשים במעט מהדגלים המסחריים (GPT-5, Claude, Gemini) — אבל ב-2026 הפער הצטמצם מאוד, וזה יותר ממספיק לרוב המשימות.
מתקינים Ollama (או LM Studio לממשק גרפי), ומריצים מודל בפקודה אחת — למשל ollama run qwen3 או ollama run llama3.3. זהו. המודל יורד ורץ מקומית.
מודלים פתוחים מובילים להתקנה מקומית (2026)
| מודל | מפתח | הכי טוב ל- | גודל / חומרה | רישיון |
|---|---|---|---|---|
| Qwen 3 | Alibaba | ברירת מחדל כללית + קוד | 8B ≈ 5GB · יש גם גדולים | Apache 2.0 |
| DeepSeek V4 | DeepSeek | reasoning ולוגיקה מורכבת | גדול (GPU חזק / הרבה RAM) | MIT |
| Llama 3.3 | Meta | התחלה קלה, צ'אט כללי | 8B ≈ 4.9GB · רץ ב-8GB RAM | Llama License |
| Gemma 3 | חומרה חלשה + מולטימודאלי | 4B ≈ 4.2GB (הכי חסכוני) | Gemma Terms | |
| Mistral | Mistral AI | קוד ומהירות | 7B ≈ 4–5GB | Apache 2.0 |
| Phi-4 | Microsoft | חומרה חלשה במיוחד | קטן, קל להרצה | MIT |
איזה מודל מקומי לבחור?
- בחירה בטוחה לכל מטרה: Qwen 3 — חזק, רב-לשוני וברישיון פתוח
- reasoning ולוגיקה: DeepSeek V4 — אבל דורש חומרה חזקה
- מחשב חלש / 8GB RAM: Gemma 3 4B או Llama 3.3 8B
- קוד: Qwen Coder או Mistral
- רישיון גמיש לגמרי (מסחרי): Qwen ו-Mistral (Apache 2.0), DeepSeek (MIT)
מודל של ~8B פרמטרים רץ בנוחות עם 8–16GB RAM (או GPU עם 6GB+ VRAM). מודלים של 70B ומעלה דורשים GPU חזק או הרבה זיכרון. אם המחשב חלש — התחל מ-Gemma 3 4B או Phi-4.
למדריך המלא על הרצה מקומית, DeepSeek והמודלים הפתוחים — כולל התקנה שלב-אחר-שלב עם Ollama ו-LM Studio — ראה DeepSeek ומודלים מקומיים.
שלושה תרחישים, ומה כל אחד באמת עולה
מספרים מופשטים קשים לשיפוט, אז הנה שלוש מערכות טיפוסיות — בלי סכומים מדויקים, כי הם משתנים, ועם סדרי הגודל והיחסים, שלא משתנים.
עוזר אישי לשימוש עצמי. כמה עשרות שיחות ביום, הקשר קצר. זה זול עד כדי כך שלא שווה לחשב — מנוי חודשי קבוע בממשק כמעט תמיד עדיף על API, וכל אופטימיזציה כאן היא בזבוז זמן.
בוט שירות על אתר. אלפי שיחות בחודש, כל אחת עם שליפה מהמסמכים. כאן העלות מתחילה להיות אמיתית, ורובה בכניסה — הקטעים שנשלפים, לא התשובה. שני המנופים שמשנים: לשלוף פחות קטעים, ולהשתמש במטמון על ההנחיה הקבועה. יחד הם לרוב מורידים את החשבון בשיעור ניכר בלי לגעת באיכות.
סוכן שמבצע משימות. פחות הרצות, וכל אחת יקרה בהרבה. כאן העלות אינה מספר הצעדים אלא סכום ההקשרים — בכל צעד נשלח מחדש כל מה שהצטבר. סוכן של עשרה צעדים אינו פי עשרה מקריאה אחת, הוא יותר. המנוף היחיד שבאמת עובד: לגזום את תוצאות הכלים בנקודת המקור.
הדפוס שמשותף לשלושתם: ככל שהמערכת יותר "חכמה", כך גדל חלקה של הכניסה בחשבון — ולכן כל עבודה על צמצום ההקשר משתלמת יותר מכל מיקוח על מחיר לטוקן.
מה לעקוב אחריו בחשבון
עלות שלא מנוטרת מתגלה בסוף החודש. שלושה מספרים שמספיקים כדי לא להיות מופתעים:
- עלות לשיחה מוצלחת — ולא עלות לקריאה. זה המספר היחיד שאפשר להשוות לערך העסקי, וגם היחיד שחושף בזבוז: מערכת זולה שעונה לא נכון אינה זולה.
- טוקנים בכניסה לאורך זמן. עלייה הדרגתית שלהם היא הסימן המוקדם לכך שההקשר תופח — היסטוריה שנגררת, תוצאות כלים שלא נגזמו, הנחיה שגדלה.
- פילוח לפי שיחה. כמעט תמיד מתברר שמיעוט קטן מהשיחות אחראי לרוב ההוצאה, ושברוב המקרים מדובר בבאג — לולאה שלא נעצרה, ניסיונות חוזרים בלי תקרה — ולא בשימוש כבד.
ועוד שתי הגנות פשוטות שכדאי להפעיל ביום הראשון: תקרת הוצאה חודשית בלוח הבקרה של הספק, והתרעה על קפיצה. קפיצה חדה בהוצאה היא כמעט תמיד תקלה, וזו ההתרעה עם ההחזר הגבוה ביותר במערכת.
מתי לא שווה לעסוק בזה
- לפני שהמערכת עובדת. אופטימיזציית עלות על משהו שעוד לא הוכיח את עצמו היא עבודה על מה שאולי ייזרק.
- בנפח נמוך. מערכת שעולה עשרות דולרים בחודש לא מצדיקה שבוע עבודה שיחסוך חצי מזה.
- כשהחיסכון פוגע באיכות. תשובה שגויה עולה יותר מכל טוקן — בזמן תיקון, ובאמון.
- כשהצוואר אינו המודל. אם רוב ההשהיה או העלות הן בשליפה, במסד הנתונים או בתשתית — שם צריך להסתכל, ולא בבחירת המודל.
ולסיום, הפרופורציה ששווה להחזיק: בחודש הראשון של מערכת חדשה, כמעט תמיד עדיף להשקיע במדידת איכות מאשר במדידת עלות. מערכת שעובדת נכון אפשר להוזיל אחר כך בכמה מנופים ידועים; מערכת זולה שעונה לא נכון צריך לבנות מחדש — וזה יקר בהרבה מכל חשבון חודשי.
שיקולים מקומיים
שלושה דברים שלא מופיעים בשום דף תמחור ומשפיעים על החשבון בישראל:
- מטבע ומע״מ. כל המחירים נקובים בדולר, והחיוב מגיע בכרטיס — כלומר חשופים לשער ולעמלת המרה. לעסק מדווח יש גם שאלת מע״מ על שירות מחו״ל, ששווה לברר מול רואה החשבון לפני ולא בדוח השנתי.
- מכפיל העברית. חוזר כאן כי הוא משפיע פעמיים: גם בעלות לקריאה, וגם בכך שחלון ההקשר מתמלא מוקדם יותר — מה שדוחף לשלבים נוספים, שכל אחד מהם קריאה נוספת.
- מה מותר לשלוח. בארגונים שמעבדים מידע רגיש, השאלה אינה כמה זה עולה אלא אם מותר בכלל. שם הרצה מקומית נכנסת לא כחיסכון אלא כתנאי — והחישוב שלה שונה לגמרי, כי הוא כולל חומרה וזמן אדם.
טעויות שחוזרות
- לחשב תקציב לפי מספר מילים. בעברית ההערכה תצא נמוכה מדי, ובמערכת רב-שלבית היא תצא נמוכה בהרבה.
- לספור קריאה אחת לכל בקשה. מערכת עם שלושה שלבים היא שלוש קריאות, ועם ניסיונות חוזרים — יותר.
- לאופטם את אורך התשובה. הכניסה היא רוב החשבון; שם נמצא הרווח.
- מודל אחד לכל השלבים. סיווג וחילוץ לא צריכים את המודל היקר.
- לוותר על עיבוד באצווה. הנחה משמעותית שמושארת על השולחן בכל מערכת שלא צריכה תשובה מיידית.
- לשבור את המטמון בלי לדעת. תאריך או שם משתמש בשורה הראשונה של ההנחיה מבטלים אותו לגמרי.
- להתעלם מתאריך סיום של מחיר מבצע. מערכת שנבנתה על תמחור מוזל צריכה לדעת מתי הוא נגמר.
- בלי תקרת הוצאה ובלי התרעה. קפיצה בחשבון היא כמעט תמיד באג, וכדאי לגלות אותה באותו יום.
- להשוות ספקים לפי הטבלה בלבד. טוקניזציה, פטפטת וניסיונות חוזרים משנים את התמונה.
- להשקיע באופטימיזציה לפני שיש נפח. בפרויקט קטן עלות המודל לרוב אינה הסעיף הגדול.
מקורות
המספרים אומתו מול מחירוני ה-API הרשמיים של הספקים (OpenAI, Anthropic, Google, xAI) נכון לאוגוסט 2026. מכיוון שהתמחור משתנה תדיר, המדריך הזה נכלל בבדיקת רעננות אוטומטית שמאמתת את המספרים מול המקורות מעת לעת.
רוצה לחתוך עלויות?
אחרי שבחרת מודל — המדריך המעשי להוזלת עלויות, והמדריכים המלאים לכל מודל.