SparkMoE - מערכת להרצת מודלי AI גדולים ועוצמתיים באופן מקומי על חומרה חלשה, עדכון - גרסה V0.3.0!
-
@חובבן-מקצועי אגב, יש שאלה שאני אוהב לשאול מודלים קטנים, ולראות את תגובתם - לסאלי יש 3 אחים. לכל אחד מאחיה יש 2 אחיות. כמה אחיות יש לסאלי?
התשובה היא כמובן 1, אבל רוב המודלים הקטנים עונים 6, 5 או 2... -
@חובבן-מקצועי אגב, יש שאלה שאני אוהב לשאול מודלים קטנים, ולראות את תגובתם - לסאלי יש 3 אחים. לכל אחד מאחיה יש 2 אחיות. כמה אחיות יש לסאלי?
התשובה היא כמובן 1, אבל רוב המודלים הקטנים עונים 6, 5 או 2... -
@א.מ.ד. לי gemma4E4B אומר 2 (כי הוא טוען שסאלי זה שם שבן ולא מוכן להסכים איתי...) ו E2B בכלל נע בין 6\5\4\3\2
@CSS-0 תבדוק, אולי במקרה כיבית את מצב חשיבה? זה משפיע על התשובה.
-
@CSS-0 תבדוק, אולי במקרה כיבית את מצב חשיבה? זה משפיע על התשובה.
-
@פתרון-AI אין לך צורך בתוכנה שלי בשביל מודלים בינוניים. אתה יכול להריץ אותם כרגיל עם LM Studio, במהירות מטורפת.
אני מדבר על מודלי MoE עד 40B, או מודלים צפופים עד כ-14B. אבל גם מודלים צפופים של 30B יעבדו מהר יחסית ע"י העברת חלק מהשכבות ל-GPU. אז תנסה את סדרות Gemma 4 ו-Qwen 3.6.
אם בכל זאת תרצה להריץ מודלי MoE גדולים יותר כמו Qwen 3.5 122B A10B, תוכל להשתמש בתוכנה שלי. היא אמורה לתמוך ב-GPU, אבל אני צריך לבדוק את זה, כי מלכתחילה לא התעסקתי בחומרה חזקה. בגרסה הבאה זה יובא בחשבון.
@אריאלל זה עונה גם לשאלתך.@א.מ.ד. בדקתי את זה עכשיו, זה אמנם עובד באופן מצוין כלפי הטעינה החלקית לזיכרון, אבל ל-GPU זה לא טוען בכלל.
זה חשוב גם למחשבים כאלה, כי לי למשל יש VRAM של 6 GB שזה קצת באופן יחסי והשאר עובר ל-RAM מה שמאט את הביצועים משמעותית ומייתר למעשה את הכרטיס גרפי.
אם תוכל להתאים את התוכנה גם ל-GPU זה יעזור מאד.
תודה על ההשקעה

-
@א.מ.ד. בדקתי את זה עכשיו, זה אמנם עובד באופן מצוין כלפי הטעינה החלקית לזיכרון, אבל ל-GPU זה לא טוען בכלל.
זה חשוב גם למחשבים כאלה, כי לי למשל יש VRAM של 6 GB שזה קצת באופן יחסי והשאר עובר ל-RAM מה שמאט את הביצועים משמעותית ומייתר למעשה את הכרטיס גרפי.
אם תוכל להתאים את התוכנה גם ל-GPU זה יעזור מאד.
תודה על ההשקעה

-
@אריאלל סתם ככה יש לך מעבד NPU שמותאם יותר לבינה מלאכותית, אין לי מושג אם כיום יש כלים שמנצלים אותו טוב יור מהתוצאות שהכרטיס הגרפי יביא, שווה לבדוק.
@החכם-השלם זה NPU שיצא לפני עידן ה AI הביתי.
יש לו אולי 7 TOPS, והוא נועד בעיקר לתכונות במצלמה כמו מעקב פנים וטשטוש. -
@א.מ.ד. בדקתי את זה עכשיו, זה אמנם עובד באופן מצוין כלפי הטעינה החלקית לזיכרון, אבל ל-GPU זה לא טוען בכלל.
זה חשוב גם למחשבים כאלה, כי לי למשל יש VRAM של 6 GB שזה קצת באופן יחסי והשאר עובר ל-RAM מה שמאט את הביצועים משמעותית ומייתר למעשה את הכרטיס גרפי.
אם תוכל להתאים את התוכנה גם ל-GPU זה יעזור מאד.
תודה על ההשקעה

-
@אריאלל אולי זה יעזור לך.
https://github.com/lyogavin/airllm -
@המלאך מה המהירות של זה?
Kimi K3 (2.8T) — the largest open-source model released to date — on under 4GB
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות