מדריך | איך לחסוך טוקנים בשימוש בכלי בינה מלאכותית על ידי קאש
-
לכלי הבינה מלאכותית יש קאש- זה אומר זיכרון זמני של הקשר השיחה הקודם שעליו לא נגבית מכסת טוקנים כל עוד הוא נשמר.
שיחה לדוגמא--כמה עולה שקית חלב $ 6.5 שח - היכן ניתן להשיג $ בסופר הקרובכשהAI עונה את התשובה השניה- אם הפרומפט השני נשלח בתוך חלון הזמן של הקאש, הטוקנים יחושבו רק על ההודעה השניה. אבל אם הפרומפט השני נשלח לאחר חלון הזמן הזה הטוקנים יחושבו מתחילת ההקשר. זה אומר תחילת השיחה או פקודת הcompact האחרונה.
חלון הזמן לקאש בקלוד לצאט- 5 דקות. לקלוד קוד-שעה. בapi 5 דקות אלא אם כן מגדירים זאת באופן ידני ואז יש לזה עלות נוספת
לכן, אם אתה קם מהמחשב ומתכנן לחזור בעוד שעה וחצי הכי משתלם יהיה לשלוח בדרך כל שהיא הודעה אפילו סתמית כמו "." או "אל תעשה כלום" כדי לשמור את הקאש. אם זה ליותר זמן שוה לשקול לתת פקודת compact לתמצות השיחה למינימום טוקנים על ידי שהבינה יוצר לעצמו תקציר של מה היה עד עכשיו. לפעמים עלול להיות חיסרון בפקודה הזאת שהבינה לא תופס את הנקודות שמבחינתך הם חשובות וכשהשיחה תמשיך אחר כך הוא לא יתייחס לכל מה שדברתם לפני כן.יש כמה דברים שגורמים לקאש להשכח לפני הזמן. למשל- שינוי הקונטקסט באמצע, שינוי המודל ועוד.
שינוי רמת החשיבה לא משכיח את הקאש.
לכן, אם רוצים לעשות compact כדי לחסוך טוקנים וכמו שהוזכר לעיל צריך לעשות את זה דווקא עם המודל הנוכחי אבל עם רמת חשיבה נמוכה. אחרת, כל הקונטקסט יטען מחדש וישרוף סתם את כל הטוקנים מההתחלה.עוד רעיון- בקלוד שעדיין יש את מגבלת השעות- אם יש לך עוד שעה וחצי ולא בוער לך דווקא עכשיו לקבל תשובה- שוה לחכות 35 דקות או קצת יותר ולשלוח רק אז את הפרומפט הבא כדי למשוך את חלון הקאש לאחרי איפוס המכסה.
מקוה שיחסוך למישהו.עוד רעיונות:
אל תתנו לבינה להשתמש בסאב אייגנט מכיון שהוא צריך ללמוד את כל ההקשר שלו מחדש. הרבה פעמים יותר זול שהוא בעצמו יעשה את העבודה.
דבר נוסף- לא תמיד יש הצדקה למעבר לרף חשיבה גבוה יותר. אנתרופיק טוענים שבאופוס 5 הם הגיעו ליעילות טוקנים לפי רמת החשיבה אבל במודלים אחרים התועלת בחשיבה ברמה גבוהה אפסית ביחס לעלות הטוקנים. אז כדאי לבדוק.
זה מדבר על המודלים בתשלום. לא יודע אם זה ככה גם בחינמיים. כתבתי ספציפית על קלוד אבל זה ככה גם באחרים. -
לכלי הבינה מלאכותית יש קאש- זה אומר זיכרון זמני של הקשר השיחה הקודם שעליו לא נגבית מכסת טוקנים כל עוד הוא נשמר.
שיחה לדוגמא--כמה עולה שקית חלב $ 6.5 שח - היכן ניתן להשיג $ בסופר הקרובכשהAI עונה את התשובה השניה- אם הפרומפט השני נשלח בתוך חלון הזמן של הקאש, הטוקנים יחושבו רק על ההודעה השניה. אבל אם הפרומפט השני נשלח לאחר חלון הזמן הזה הטוקנים יחושבו מתחילת ההקשר. זה אומר תחילת השיחה או פקודת הcompact האחרונה.
חלון הזמן לקאש בקלוד לצאט- 5 דקות. לקלוד קוד-שעה. בapi 5 דקות אלא אם כן מגדירים זאת באופן ידני ואז יש לזה עלות נוספת
לכן, אם אתה קם מהמחשב ומתכנן לחזור בעוד שעה וחצי הכי משתלם יהיה לשלוח בדרך כל שהיא הודעה אפילו סתמית כמו "." או "אל תעשה כלום" כדי לשמור את הקאש. אם זה ליותר זמן שוה לשקול לתת פקודת compact לתמצות השיחה למינימום טוקנים על ידי שהבינה יוצר לעצמו תקציר של מה היה עד עכשיו. לפעמים עלול להיות חיסרון בפקודה הזאת שהבינה לא תופס את הנקודות שמבחינתך הם חשובות וכשהשיחה תמשיך אחר כך הוא לא יתייחס לכל מה שדברתם לפני כן.יש כמה דברים שגורמים לקאש להשכח לפני הזמן. למשל- שינוי הקונטקסט באמצע, שינוי המודל ועוד.
שינוי רמת החשיבה לא משכיח את הקאש.
לכן, אם רוצים לעשות compact כדי לחסוך טוקנים וכמו שהוזכר לעיל צריך לעשות את זה דווקא עם המודל הנוכחי אבל עם רמת חשיבה נמוכה. אחרת, כל הקונטקסט יטען מחדש וישרוף סתם את כל הטוקנים מההתחלה.עוד רעיון- בקלוד שעדיין יש את מגבלת השעות- אם יש לך עוד שעה וחצי ולא בוער לך דווקא עכשיו לקבל תשובה- שוה לחכות 35 דקות או קצת יותר ולשלוח רק אז את הפרומפט הבא כדי למשוך את חלון הקאש לאחרי איפוס המכסה.
מקוה שיחסוך למישהו.עוד רעיונות:
אל תתנו לבינה להשתמש בסאב אייגנט מכיון שהוא צריך ללמוד את כל ההקשר שלו מחדש. הרבה פעמים יותר זול שהוא בעצמו יעשה את העבודה.
דבר נוסף- לא תמיד יש הצדקה למעבר לרף חשיבה גבוה יותר. אנתרופיק טוענים שבאופוס 5 הם הגיעו ליעילות טוקנים לפי רמת החשיבה אבל במודלים אחרים התועלת בחשיבה ברמה גבוהה אפסית ביחס לעלות הטוקנים. אז כדאי לבדוק.
זה מדבר על המודלים בתשלום. לא יודע אם זה ככה גם בחינמיים. כתבתי ספציפית על קלוד אבל זה ככה גם באחרים. -
לכלי הבינה מלאכותית יש קאש- זה אומר זיכרון זמני של הקשר השיחה הקודם שעליו לא נגבית מכסת טוקנים כל עוד הוא נשמר.
שיחה לדוגמא--כמה עולה שקית חלב $ 6.5 שח - היכן ניתן להשיג $ בסופר הקרובכשהAI עונה את התשובה השניה- אם הפרומפט השני נשלח בתוך חלון הזמן של הקאש, הטוקנים יחושבו רק על ההודעה השניה. אבל אם הפרומפט השני נשלח לאחר חלון הזמן הזה הטוקנים יחושבו מתחילת ההקשר. זה אומר תחילת השיחה או פקודת הcompact האחרונה.
חלון הזמן לקאש בקלוד לצאט- 5 דקות. לקלוד קוד-שעה. בapi 5 דקות אלא אם כן מגדירים זאת באופן ידני ואז יש לזה עלות נוספת
לכן, אם אתה קם מהמחשב ומתכנן לחזור בעוד שעה וחצי הכי משתלם יהיה לשלוח בדרך כל שהיא הודעה אפילו סתמית כמו "." או "אל תעשה כלום" כדי לשמור את הקאש. אם זה ליותר זמן שוה לשקול לתת פקודת compact לתמצות השיחה למינימום טוקנים על ידי שהבינה יוצר לעצמו תקציר של מה היה עד עכשיו. לפעמים עלול להיות חיסרון בפקודה הזאת שהבינה לא תופס את הנקודות שמבחינתך הם חשובות וכשהשיחה תמשיך אחר כך הוא לא יתייחס לכל מה שדברתם לפני כן.יש כמה דברים שגורמים לקאש להשכח לפני הזמן. למשל- שינוי הקונטקסט באמצע, שינוי המודל ועוד.
שינוי רמת החשיבה לא משכיח את הקאש.
לכן, אם רוצים לעשות compact כדי לחסוך טוקנים וכמו שהוזכר לעיל צריך לעשות את זה דווקא עם המודל הנוכחי אבל עם רמת חשיבה נמוכה. אחרת, כל הקונטקסט יטען מחדש וישרוף סתם את כל הטוקנים מההתחלה.עוד רעיון- בקלוד שעדיין יש את מגבלת השעות- אם יש לך עוד שעה וחצי ולא בוער לך דווקא עכשיו לקבל תשובה- שוה לחכות 35 דקות או קצת יותר ולשלוח רק אז את הפרומפט הבא כדי למשוך את חלון הקאש לאחרי איפוס המכסה.
מקוה שיחסוך למישהו.עוד רעיונות:
אל תתנו לבינה להשתמש בסאב אייגנט מכיון שהוא צריך ללמוד את כל ההקשר שלו מחדש. הרבה פעמים יותר זול שהוא בעצמו יעשה את העבודה.
דבר נוסף- לא תמיד יש הצדקה למעבר לרף חשיבה גבוה יותר. אנתרופיק טוענים שבאופוס 5 הם הגיעו ליעילות טוקנים לפי רמת החשיבה אבל במודלים אחרים התועלת בחשיבה ברמה גבוהה אפסית ביחס לעלות הטוקנים. אז כדאי לבדוק.
זה מדבר על המודלים בתשלום. לא יודע אם זה ככה גם בחינמיים. כתבתי ספציפית על קלוד אבל זה ככה גם באחרים.@חמור-חמורותיים תודה! מועיל מאוד
אגב, אפשר פשוט לומר לו לתזמן בדיקה של הPR כל 50 דקותתגובת קלוד ° כן, שתי המסקנות שלך נכונות:
1. ההקשר נשמר למשך שעה
התיעוד שלי אומר בבירור:
"This session's requests use a 1-hour Anthropic prompt-cache TTL, so effectively every allowed delay (the runtime clamps to [60, 3600]) wakes up with your conversation context still cached."
כל בדיקה עד שעה מ-עכשיו תקבל את ההקשר מה-cache — לא תוך חישוב מחדש של התשובה.
2. תיזמון של 50 דקות זה בדיוק מה שצריך
התיעוד אומר:
"Don't think in cache windows — think about what you're actually waiting for."
ול-PR activity:
"schedule a self check-in roughly an hour out before ending your turn"
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות