הסבר | אז למה בתכל'ס Claude הרבה יותר יקר מהמודלים המתחרים? ולמה המכסות בקלוד קוד מתחסלות כל כך מהר?
-
כל מי שעובד עם Claude, ובמיוחד מי שמשתמש בכלי כמו Claude Code או עובד דרך ה-API עם סוכן אחר, ודאי שם לב לתופעה כואבת - המכסות נשרפות בקצב מסחרר, והחשבון ב-API מגיע למספרים לא הגיוניים בהשוואה למתחרים.
השאלה שתמיד עולה היא, האם זה סתם תמחור יקר לכל טוקן, או שיש כאן משהו עמוק יותר מאחורי הקלעים?
הגרף הבא מתוך Artificial Analysis נותן לנו את התשובה המדויקת, והיא טמונה במדד אחד קריטי: כמות טוקני הפלט שהמודל מייצר כדי לפתור משימה.
מה אנחנו רואים בגרף?
המדד בודק כמה טוקנים של פלט (חלוקה בין טוקני חשיבה לבין טוקני התשובה בפועל) המודלים צורכים בממוצע לכל משימת Benchmark:

מה המשמעות של המספרים האלה?
-
פי 5 עד פי 7 יותר פלט!
שימו לב להבדל הקיצוני: בזמן שמודל מסדרת GPT 6/6.1 מסתפק בממוצע ב-27,000 עד 38,000 טוקנים למשימה, Claude Sonnet פולט כמעט 200,000 טוקנים לאותה משימה בדיוק. -
טוקן פלט עולה משמעותית יותר מטוקן קלט (Input):
בכל חברות ה-AI, מחירי טוקני הפלט יקרים פי 3 עד פי 5 ממחירי טוקני הקלט. כשמודל מרחיב, חופר ומפרט פי כמה וכמה - העלות הכוללת של ה-API מוכפלת פי כמה באותה משימה. -
למה זה קריטי ב-Claude Code?
ברתמות סוכן, המודל מקבל החלטות בלולאה: קורא קבצים, מנמק, מריץ טרמינל, בודק שגיאות ומנסח תשובות. כאשר בכל צעד כזה החשיבה והפלט ארוכים כל כך, מגבלות ה-Rate Limit והתקציב החודשי נגמרים במהירות הבזק.
זו הסיבה לכך שאף על פי שהתמחור של GPT 6.1 Sol יקר ב-25% מזה של קלוד אופוס 5.5 (4$ קלט ו-20$ פלט, לעומת 5$ קלט ו-25$ פלט), בפועל קלוד צורך פי כמה וכמה יותר טוקנים, מה שמצמצם משמעותית את מספר המשימות האפשריות בכל מכסה, והופך את מודלי GPT לשימושיים יותר מהבחינה הזו.
אני אישית השתמשתי ב-GPT 6.1 Sol על חשיבה אקסטרה-גבוהה, בפרויקט גדול ומורכב עם הקשר ענק (SmartiAI), והוא עבד לי כמעט ברציפות במשך כל 5 השעות, והמכסה הסתיימה רק 3 דקות לפני תום המכסה! (יש לי מנוי Plus).
-
-
לא בדקתי לעומק אבל מעבודות שהבאתי לgpt לעשות ולקלוד לעשות בסונט 5 עוד בזמנו
התוצאות של קלוד היו הרבה יותר טובות והמכסה גם שם לא נגמרת לי מהר והוא על מצב חשיבה גבוה
ובסול המכסה נגמרה לי הרבה יותר מהרכנראה יש לך סקילים של אדם קדמון או משהו בסגנון לי אין כאלה
-
-
@א.מ.ד. אז אוליי זה תלוי במשימה? כי אם לדוגמא הוא בסך הכל מבצע קומפילצייה אז הוא לא עושה כלום רק מסתכל ואם הוא עושה חמישים פעמים קומפילציות אז בכלל הוא לא עשה כלום במשך החמש שעות וכתוב שהוא עבד חמש שעות...
בכל אופן במציאות אצלי המצב ממש הפוך!@א.מ.ד. אז אוליי זה תלוי במשימה? כי אם לדוגמא הוא בסך הכל מבצע קומפילצייה אז הוא לא עושה כלום רק מסתכל ואם הוא עושה חמישים פעמים קומפילציות אז בכלל הוא לא עשה כלום במשך החמש שעות וכתוב שהוא עבד חמש שעות...
בכל אופן במציאות אצלי המצב ממש הפוך!לא, זו הייתה משימה שבה הוא כתב קוד ובדיקות כל הזמן.
-
כל מי שעובד עם Claude, ובמיוחד מי שמשתמש בכלי כמו Claude Code או עובד דרך ה-API עם סוכן אחר, ודאי שם לב לתופעה כואבת - המכסות נשרפות בקצב מסחרר, והחשבון ב-API מגיע למספרים לא הגיוניים בהשוואה למתחרים.
השאלה שתמיד עולה היא, האם זה סתם תמחור יקר לכל טוקן, או שיש כאן משהו עמוק יותר מאחורי הקלעים?
הגרף הבא מתוך Artificial Analysis נותן לנו את התשובה המדויקת, והיא טמונה במדד אחד קריטי: כמות טוקני הפלט שהמודל מייצר כדי לפתור משימה.
מה אנחנו רואים בגרף?
המדד בודק כמה טוקנים של פלט (חלוקה בין טוקני חשיבה לבין טוקני התשובה בפועל) המודלים צורכים בממוצע לכל משימת Benchmark:

מה המשמעות של המספרים האלה?
-
פי 5 עד פי 7 יותר פלט!
שימו לב להבדל הקיצוני: בזמן שמודל מסדרת GPT 6/6.1 מסתפק בממוצע ב-27,000 עד 38,000 טוקנים למשימה, Claude Sonnet פולט כמעט 200,000 טוקנים לאותה משימה בדיוק. -
טוקן פלט עולה משמעותית יותר מטוקן קלט (Input):
בכל חברות ה-AI, מחירי טוקני הפלט יקרים פי 3 עד פי 5 ממחירי טוקני הקלט. כשמודל מרחיב, חופר ומפרט פי כמה וכמה - העלות הכוללת של ה-API מוכפלת פי כמה באותה משימה. -
למה זה קריטי ב-Claude Code?
ברתמות סוכן, המודל מקבל החלטות בלולאה: קורא קבצים, מנמק, מריץ טרמינל, בודק שגיאות ומנסח תשובות. כאשר בכל צעד כזה החשיבה והפלט ארוכים כל כך, מגבלות ה-Rate Limit והתקציב החודשי נגמרים במהירות הבזק.
זו הסיבה לכך שאף על פי שהתמחור של GPT 6.1 Sol יקר ב-25% מזה של קלוד אופוס 5.5 (4$ קלט ו-20$ פלט, לעומת 5$ קלט ו-25$ פלט), בפועל קלוד צורך פי כמה וכמה יותר טוקנים, מה שמצמצם משמעותית את מספר המשימות האפשריות בכל מכסה, והופך את מודלי GPT לשימושיים יותר מהבחינה הזו.
אני אישית השתמשתי ב-GPT 6.1 Sol על חשיבה אקסטרה-גבוהה, בפרויקט גדול ומורכב עם הקשר ענק (SmartiAI), והוא עבד לי כמעט ברציפות במשך כל 5 השעות, והמכסה הסתיימה רק 3 דקות לפני תום המכסה! (יש לי מנוי Plus).
-
-
@א.מ.ד. סונט מייצר יותר טוקנים מאופוס ? זה הגיוני ?
ומה זה אומר - שעדיף להשתמש באופוס כי זה גם ככה יותר זול בשקלול כמות הטוקנים והמחיר ?@א.מ.ד. סונט מייצר יותר טוקנים מאופוס ? זה הגיוני ?
ככה רואים במדד. ברור שזה הגיוני, ככל שהמודל קטן יותר הוא צורך יותר חשיבה כדי לפצות על גודלו. אתה יכול לראות את זה גם בחברות האחרות שבמדד.
ומה זה אומר - שעדיף להשתמש באופוס כי זה גם ככה יותר זול בשקלול כמות הטוקנים והמחיר ?
ייתכן מאוד, אם המדדים נכונים. אתה יכול לבדוק את זה בעצמך - להפעיל את שניהם על משימה זהה, ולבדוק בפירוט הטוקנים כמה קלט/פלט/מטמון ולחשב.
-
ברור שאופוס יוצא יותר יקר בסך הכל מסונטה, (לא תמיד צריך להאמין למדדים של אתרים ולסמוך עליהם עדיף פשוט לבדוק בעיניים...)
-
ברור שאופוס יוצא יותר יקר בסך הכל מסונטה, (לא תמיד צריך להאמין למדדים של אתרים ולסמוך עליהם עדיף פשוט לבדוק בעיניים...)
לא הרי הבדיקה שלך כבדיקה של מישהו אחר...
-
@mefateach

הוא טען שבמצב היג' זה נגמר לו רק 5 דקות לפני סיום המכסה -
@א.מ.ד. הצד השווה שאותו משימה וודאי תצא זולה יותר (אחרת הם לא היו מייצרים מודל שעולה אותו מחיר והוא יותר טיפש....)
@א.מ.ד. הצד השווה שאותו משימה וודאי תצא זולה יותר
למעשה יש להם מדד גם לזה, ואפשר לראות שאותה משימה יקרה יותר בסונט מאשר באופוס. גם אם לא בהרבה, אבל זה כבר מוריד את ייתרון המחיר של סונט על אופוס.

(אחרת הם לא היו מייצרים מודל שעולה אותו מחיר והוא יותר טיפש....)
על GPT 5.6 Terra שמעת?
-
@mefateach

הוא טען שבמצב היג' זה נגמר לו רק 5 דקות לפני סיום המכסההוא טען שבמצב היג' זה נגמר לו רק 5 דקות לפני סיום המכסה
רמת החשיבה לא משנה - אין הבדל אם המודל חושב או עונה תשובה סופית באותו זמן. אולי זה רק משנה קצת את יחס הזמן של יצירת הטוקנים מול המתנה לתוצאות כלים.
בכל אופן, השתמשתי באקסטרה-גבוה, לא רק גבוה. וגם עכשיו ממש הסתיימה לי מכסת ה-5 שעות אחרי עבודה צפופה, כשהאיפוס הוא בעוד 27 דקות.
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות