SparkMoE - מערכת להרצת מודלי AI גדולים ועוצמתיים באופן מקומי על חומרה חלשה, עדכון - גרסה V0.3.0!
-
@א.מ.ד. כתבתי לך בצ'אט לגבי טעינת מודלי עזר (אני רוצה ליצור PR עם מה שעשיתי ושתבדוק את זה)
-
@א.מ.ד. אם יש לי מחשב קלאסי עם 16 RAM עם התוכנה שלך איזה מודל הוא הכי טוב לי לשימוש יום יומי לצורך קידוד וסתם דיבורים וכו' (והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
@הישבשר-המלומד יש לך כרטיס מסך?
באופן כללי התוכנה שלו איטית הרבה יותר מlama.cpp,
אבל אם בכל את תרצה - כל מודל MoE נתמך.
בשבילך - Gemma 4. -
@א.מ.ד. אם יש לי מחשב קלאסי עם 16 RAM עם התוכנה שלך איזה מודל הוא הכי טוב לי לשימוש יום יומי לצורך קידוד וסתם דיבורים וכו' (והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
@א.מ.ד. אם יש לי מחשב קלאסי עם 16 RAM עם התוכנה שלך איזה מודל הוא הכי טוב לי לשימוש יום יומי לצורך קידוד וסתם דיבורים וכו' (והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
Qwen 3.6 35B לקידוד, Gemma 4 26B לשימוש כללי.
-
@הישבשר-המלומד יש לך כרטיס מסך?
באופן כללי התוכנה שלו איטית הרבה יותר מlama.cpp,
אבל אם בכל את תרצה - כל מודל MoE נתמך.
בשבילך - Gemma 4. -
@א.מ.ד. כתבתי לך בצ'אט לגבי טעינת מודלי עזר (אני רוצה ליצור PR עם מה שעשיתי ושתבדוק את זה)
-
-
-
@א.מ.ד. אם יש לי מחשב קלאסי עם 16 RAM עם התוכנה שלך איזה מודל הוא הכי טוב לי לשימוש יום יומי לצורך קידוד וסתם דיבורים וכו' (והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
(והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
כן! כמובן באיטיות, אבל אם אין לך כרגע אינטרנט ואתה רוצה בכל זאת להשתמש בסמארטי, זה יכול להיות שימושי!
אבל כדאי שתחכה לגרסה הבאה של סמארטי, שחוסכת משמעותית בטוקנים (הצלחתי לצמצם את הנחיית המערכת לשאילתא בסיסית מכ-23,000 טוקנים לכ-5,000 טוקנים!), מה שאומר שהעיבוד יהיה מהיר בהרבה, וכוללת עוד התאמות להאצת העיבוד, והיא תכלול התאמה מיוחדת למודלים מקומיים שתצמצם עוד יותר את הנחיית המערכת ותסיר חלקים פחות חשובים.
לדוגמה מקודם השתמשתי בסמארטי עם Qwen 3.5 4B כדי לבדוק מזג אוויר, ותוך 2-3 דקות המשימה בוצעה בהצלחה (בעברית!).

-
@א.מ.ד. אם יש לי מחשב קלאסי עם 16 RAM עם התוכנה שלך איזה מודל הוא הכי טוב לי לשימוש יום יומי לצורך קידוד וסתם דיבורים וכו' (והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
Qwen 3.6 35B לקידוד, Gemma 4 26B לשימוש כללי.
-
@א.מ.ד. בשביל זה אני גם צריך את התוכנה שלך או שאני יכול להריץ לבד,
@א.מ.ד. בשביל זה אני גם צריך את התוכנה שלך או שאני יכול להריץ לבד,
אתה יכול להריץ לבד מודלים קטנים כמו Qwen 3.5 4B (אבל כמו שכתבתי גם ככה תצטרך לחכות לגרסה הבאה של סמארטי), אבל למודלים גדולים כמו Qwen 3.6 35B תצטרך את התוכנה שלי.
-
(והאם ביחד עם התוכנה הזאת אני יוכל להריץ את התוכנה שלך (סמרטי) עם מודל אופליין גדול)?
כן! כמובן באיטיות, אבל אם אין לך כרגע אינטרנט ואתה רוצה בכל זאת להשתמש בסמארטי, זה יכול להיות שימושי!
אבל כדאי שתחכה לגרסה הבאה של סמארטי, שחוסכת משמעותית בטוקנים (הצלחתי לצמצם את הנחיית המערכת לשאילתא בסיסית מכ-23,000 טוקנים לכ-5,000 טוקנים!), מה שאומר שהעיבוד יהיה מהיר בהרבה, וכוללת עוד התאמות להאצת העיבוד, והיא תכלול התאמה מיוחדת למודלים מקומיים שתצמצם עוד יותר את הנחיית המערכת ותסיר חלקים פחות חשובים.
לדוגמה מקודם השתמשתי בסמארטי עם Qwen 3.5 4B כדי לבדוק מזג אוויר, ותוך 2-3 דקות המשימה בוצעה בהצלחה (בעברית!).

@א.מ.ד. יצא לי להשתמש בתוכנה שלך, יותר נכון עברתי לתוכנה שלך מאולמה, הוא מגיב פי 1000 יותר מהר, באולמה הוא היה חושב בין דקה לשלוש דקות לפני שהוא מתחיל לענות!!!
(אני עם I7 דור 11 16 ראם) אשמח לדעת איזה מודל יתאים לדעתך.
וכן אשמח לדעת מה רמת ההזיות (נראלי מכונה 'טמפרטורה') שהגדרת לו? -
@א.מ.ד. יצא לי להשתמש בתוכנה שלך, יותר נכון עברתי לתוכנה שלך מאולמה, הוא מגיב פי 1000 יותר מהר, באולמה הוא היה חושב בין דקה לשלוש דקות לפני שהוא מתחיל לענות!!!
(אני עם I7 דור 11 16 ראם) אשמח לדעת איזה מודל יתאים לדעתך.
וכן אשמח לדעת מה רמת ההזיות (נראלי מכונה 'טמפרטורה') שהגדרת לו?יצא לי להשתמש בתוכנה שלך, יותר נכון עברתי לתוכנה שלך מאולמה, הוא מגיב פי 1000 יותר מהר, באולמה הוא היה חושב בין דקה לשלוש דקות לפני שהוא מתחיל לענות!!!
@החכם-השלם זה לא הגיוני.
יש לך nvmi?
-
@א.מ.ד. יצא לי להשתמש בתוכנה שלך, יותר נכון עברתי לתוכנה שלך מאולמה, הוא מגיב פי 1000 יותר מהר, באולמה הוא היה חושב בין דקה לשלוש דקות לפני שהוא מתחיל לענות!!!
(אני עם I7 דור 11 16 ראם) אשמח לדעת איזה מודל יתאים לדעתך.
וכן אשמח לדעת מה רמת ההזיות (נראלי מכונה 'טמפרטורה') שהגדרת לו?(אני עם I7 דור 11 16 ראם) אשמח לדעת איזה מודל יתאים לדעתך.
המודלים המומלצים שבפוסט הראשי.
וכן אשמח לדעת מה רמת ההזיות (נראלי מכונה 'טמפרטורה') שהגדרת לו?
זה מוגדר אוטומטית אני חושב בהתאם למודל, אבל אתה יכול להגדיר את זה כרצונך בהגדרות.
-
(אני עם I7 דור 11 16 ראם) אשמח לדעת איזה מודל יתאים לדעתך.
המודלים המומלצים שבפוסט הראשי.
וכן אשמח לדעת מה רמת ההזיות (נראלי מכונה 'טמפרטורה') שהגדרת לו?
זה מוגדר אוטומטית אני חושב בהתאם למודל, אבל אתה יכול להגדיר את זה כרצונך בהגדרות.
-
יצא לי להשתמש בתוכנה שלך, יותר נכון עברתי לתוכנה שלך מאולמה, הוא מגיב פי 1000 יותר מהר, באולמה הוא היה חושב בין דקה לשלוש דקות לפני שהוא מתחיל לענות!!!
@החכם-השלם זה לא הגיוני.
יש לך nvmi?
-
@החכם-השלם זה לא הגיוני.
זה הגיוני כי זה llama.cpp המקורי ולא Ollama שמתלבש עליו. כמובן לא פי אלף אבל כן יותר מהיר (במודלים רגילים כמובן, לא במודלי MoE שבעיקר עבורם נועדה התוכנה).
-
SparkMoE

בהשראת הפרויקט שהוזכר כאן ע"י @המלאך - בשם colibri, שבו קבוצת חוקרים הצליחו להריץ את המודל העוצמתי GLM 5.2 על חומרה ביתית, עם כמה עשרות GB RAM "בלבד" (לצורך ההרצה נטו נצרכו כ-25 RAM), החלטתי ליצור פרויקט דומה אך שונה, שיתאים לחומרה חלשה באמת ויריץ מודלי MoE בגודל בינוני, כמו Qwen 3.6 35B A3B ו-Gemma 4 26B A4B, במכשירים עם 8/16 GB RAM (לא נבדק על 8 RAM, אבל אמור לעבוד באותה מידה).
לכאורה זה אמור להתאים גם להרצת מודלי MoE גדולים מאוד של מאות B פרמטרים על חומרה בינונית (32 GB RAM ומעלה), אבל לצערי אין לי חומרה כזו כך שאין לי איך לנסות אם זה באמת עובד...הרעיון המרכזי שעומד מאחורי הפרויקט הוא השארת המודל המלא על ה-SSD (כונן האחסון), וטעינת ופריקת מומחי ה-MoE באופן דינמי ל-RAM לפי הצורך. זה מאפשר הרצת מודלים בינוניים (20-40B פרמטרים) על גבי מכשירים עם RAM צרכני קלאסי, אף ללא GPU, מכיון שלא מתבצעת טעינה מלאה של כלל המודל ל-RAM.
כרגע הצלחתי להגיע ב-SparkMoE במודל Qwen 3.6 35B A3B עם MTP מופעל לבערך 4 טוקנים לשניה - איטי אבל שמיש. בגרסאות הבאות בעז"ה אני אנסה להאיץ ככל האפשר את ההסקה.
המהירות תלויה במהירות הקריאה מה-SSD, מספר ליבות ושרשורי מעבד, רוחב פס ועוד, לכן במחשב שמצטיין באלה ההסקה תהיה מהירה יותר.שימו לב: בהרצה הראשונה של המודל לאחר הפעלת השרת המקומי, ההסקה איטית יותר, אך עם התקדמות היצירה ההסקה מאיצה, בשל כך שחלק מהמומחים שכבר היו בשימוש כבר נמצאים במטמון המהיר יותר מה-SSD.
SparkMoE תומך בכל הפונקציונליות הקיימת של פרוייקט llama.cpp המקורי, כמו MTP, שרת OpenAI מקומי ועוד.
כמו כן, SparkMoE תומך גם במודלים צפופים רגילים, לא רק במודלי MoE, אבל במודלים רגילים ההסקה היא רק בגודל מודל סטנדרטי.אופן ההרצה:
כדי להריץ מודל גדול עם SparkMoE, יש להפעיל את התוכנה, ובממשק הדשבורד המופיע בדפדפן יש לבחור (בהפעלה הראשונה) בתיקיית מודלים (גם תתי-תיקיות נתמכות, כך שאפשר להשתמש בתיקיית Models של LM Studio), לבחור מודל, ואז ללחוץ על "הפעל מודל". להמתין לטעינת המודל עד שכפתור "פתיחת הצ'אט" נהיה זמין.
בלחיצה על "פתיחת הצ'אט", ייפתח בכרטיסיה חדשה בדפדפן ממשק הצ'אט של SparkMoE.
בממשק הצ'אט ניתן לשנות הגדרות רבות, כמו MTP, הודעת מערכת, פרמטרי הסקה ועוד, בלשונית "הגדרות". ניתן גם להגדיר רמת חשיבה.
תמונות לדוגמה:
ניהול השרת:

ממשק הצ'אט והגדרות ההסקה:

מודלים תואמים מומלצים:
כרגע עדיין אסור ע"פ חוקי הפורום להעלות מודלי AI באופן ישיר בשל "פריצת סינונים", אבל מצורפים כמה קישורים עבור מודלי MoE בגודל בינוני, במידה והם פתוחים בסינון המותקן אצלכם:
מומלץ להוריד את קוונטיזציית Q4 של כל מודל, או IQ4 אם קיים.
אם החומרה שברשותכם בעלת 32 GB RAM ומעלה, אפשר להתקדם למודלי MoE גדולים יותר.עדכונים:
- עדכון V0.3.0:
תוקנה תמיכה במודל Gemma 4 26B, שיפורי מהירות בכלל מודלי MoE, ותיקוני באגים.
הורדה:
הפרוייקט זמין בקוד פתוח בגיטהאב, ראו כאן.
ניתן להוריד קובץ EXE להתקנה מהירה מה-releases, או גרסת ZIP ניידת (לחלץ לתיקיה ולהפעיל את SparkMoE.exe).
אל תשכחו לשים
במאגר בגיטהאב על הדרך!
(הקוד המקורי של llama.cpp ברישיון MIT, והחלקים שלי תחת רישיון לא מסחרי).
אשמח לשמוע על המהירות והביצועים של המודלים השונים על חומרות שונות, וכן לקבל משוב על התוכנה עצמה!
@א.מ.ד. למה כשאני פותח את זה מSparkMoE.exe זה נפתח (מלבד התוכנה באמצעות הדפדפן) גם חלון קונסול.
וכשביקשתי מסמארטי שיפתח את זה הוא פתח ולא נפתח הקונסול.
זה אני טיפש או שהוא חכם?
וא"כ אפשר אולי לעשות פאואר של שפותח את זה בלי הקונסול? - עדכון V0.3.0:
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות
