דילוג לתוכן
  • חוקי הפורום
  • פופולרי
  • לא נפתר
  • משתמשים
  • חיפוש גוגל בפורום
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
מתמחים טופ
  1. דף הבית
  2. קטגוריות בהרצה
  3. תכנות
  4. בינה מלאכותית - AI
  5. עזרה הדדית - בינה מלאכותית
  6. SparkMoE - מערכת להרצת מודלי AI גדולים ועוצמתיים באופן מקומי על חומרה חלשה, עדכון - גרסה V0.3.0!

SparkMoE - מערכת להרצת מודלי AI גדולים ועוצמתיים באופן מקומי על חומרה חלשה, עדכון - גרסה V0.3.0!

מתוזמן נעוץ נעול הועבר עזרה הדדית - בינה מלאכותית
57 פוסטים 17 כותבים 1.4k צפיות 24 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
תגובה
  • תגובה כנושא
התחברו כדי לפרסם תגובה
נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
  • בנימין מחשביםב בנימין מחשבים

    @המלאך כן. הוא כתב את זה במפורש.
    @א.מ.ד. אין משהו דומה שיהיה מקביל לתוכנה שעובדת ישירות על הקבצים במחשב? (המקבילה החדשה לLM Studio שכחתי את שמה)

    א.מ.ד.א מחובר
    א.מ.ד.א מחובר
    א.מ.ד.
    מדריכים
    כתב נערך לאחרונה על ידי א.מ.ד.
    #44

    @בנימין-מחשבים אתה מתכוון ל-Bionic? בינתיים לא עפתי עליה.
    אבל אתה יכול לנסות לחבר מודלים גדולים מקומיים לסמארטי (ולהשבית את הכלים המיותרים כדי להאיץ עיבוד)

    מפתח אפליקציות אנדרואיד ויישומי ומודלי AI

    תגובה 1 תגובה אחרונה
    0
    • בנימין מחשביםב בנימין מחשבים

      @המלאך כן. הוא כתב את זה במפורש.
      @א.מ.ד. אין משהו דומה שיהיה מקביל לתוכנה שעובדת ישירות על הקבצים במחשב? (המקבילה החדשה לLM Studio שכחתי את שמה)

      המלאךה מנותק
      המלאךה מנותק
      המלאך
      כתב נערך לאחרונה על ידי
      #45

      @בנימין-מחשבים כתב:

      המקבילה

      לא מקבילה ולא נעליים.
      פשוט במקום צאט = סוכן.

      "Code shapes logic, AI expands vision."

      תגובה 1 תגובה אחרונה
      0
      • בנימין מחשביםב בנימין מחשבים

        @א.מ.ד. פשוט מטורף!
        האמון שלי ביכולת של אדם אחד ליצור דבר כזה לא הייתה גבוהה
        אבל לראשונה עכשיו ניסיתי להריץ מודל ממש קטן על מחשב ממש חלש (I5 ישן 8 רם בלי GPU) וזה לא זז
        התקנתי את המערכת שלך וזה רץ! מדהים!!

        א.מ.ד.א מחובר
        א.מ.ד.א מחובר
        א.מ.ד.
        מדריכים
        כתב נערך לאחרונה על ידי א.מ.ד.
        #46

        @בנימין-מחשבים כתב:

        @א.מ.ד. פשוט מטורף!
        האמון שלי ביכולת של אדם אחד ליצור דבר כזה לא הייתה גבוהה
        אבל לראשונה עכשיו ניסיתי להריץ מודל ממש קטן על מחשב ממש חלש (I5 ישן 8 רם בלי GPU) וזה לא זז
        התקנתי את המערכת שלך וזה רץ! מדהים!!

        תודה על הפירגון, אבל כדי להיות הוגן אני חייב להדגיש שהמערכת הבסיסית (llama.cpp) נבנתה ועדיין מתוחזקת במלואה במשך 3 שנים ע"י מפתח מוכשר בשם גרגנוב וקהילת ה-AI המקומי. אני רק עשיתי התאמה למחשבים חלשים ע"י ניהול חכם של הזיכרון והעברת מומחים לדיסק במקום לזיכרון, מה שמתבטא בעיקר במודלי MoE, וכן הוספתי פיצ'רים קטנים והתאמתי את המערכת שלא תצריך הבנה בשורת הפקודה.
        אבל ממש לא אני יצרתי את הבסיס.
        אגב, גם LM Studio וגם Ollama (שמנודה בקהילה הנ"ל בשל ייחוס העבודה לעצמם ומטעמים נוספים) מבוססות על llama.cpp כמנוע הרצה.

        מפתח אפליקציות אנדרואיד ויישומי ומודלי AI

        תגובה 1 תגובה אחרונה
        3
        • י מנותק
          י מנותק
          ישראל123
          כתב נערך לאחרונה על ידי
          #47

          @א.מ.ד. איך אפשר שזה יטען את המודל ביחד עם מודל את הקבצים המשלימים?
          526fc029-421c-4cf1-9a3a-c8c7ff081d4b-image.jpeg

          תגובה 1 תגובה אחרונה
          0
          • א.מ.ד.א א.מ.ד.

            SparkMoE

            SparkMoE.png

            בהשראת הפרויקט שהוזכר כאן ע"י @המלאך - בשם colibri, שבו קבוצת חוקרים הצליחו להריץ את המודל העוצמתי GLM 5.2 על חומרה ביתית, עם כמה עשרות GB RAM "בלבד" (לצורך ההרצה נטו נצרכו כ-25 RAM), החלטתי ליצור פרויקט דומה אך שונה, שיתאים לחומרה חלשה באמת ויריץ מודלי MoE בגודל בינוני, כמו Qwen 3.6 35B A3B ו-Gemma 4 26B A4B, במכשירים עם 8/16 GB RAM (לא נבדק על 8 RAM, אבל אמור לעבוד באותה מידה).
            לכאורה זה אמור להתאים גם להרצת מודלי MoE גדולים מאוד של מאות B פרמטרים על חומרה בינונית (32 GB RAM ומעלה), אבל לצערי אין לי חומרה כזו כך שאין לי איך לנסות אם זה באמת עובד...

            הרעיון המרכזי שעומד מאחורי הפרויקט הוא השארת המודל המלא על ה-SSD (כונן האחסון), וטעינת ופריקת מומחי ה-MoE באופן דינמי ל-RAM לפי הצורך. זה מאפשר הרצת מודלים בינוניים (20-40B פרמטרים) על גבי מכשירים עם RAM צרכני קלאסי, אף ללא GPU, מכיון שלא מתבצעת טעינה מלאה של כלל המודל ל-RAM.

            כרגע הצלחתי להגיע ב-SparkMoE במודל Qwen 3.6 35B A3B עם MTP מופעל לבערך 4 טוקנים לשניה - איטי אבל שמיש. בגרסאות הבאות בעז"ה אני אנסה להאיץ ככל האפשר את ההסקה.
            המהירות תלויה במהירות הקריאה מה-SSD, מספר ליבות ושרשורי מעבד, רוחב פס ועוד, לכן במחשב שמצטיין באלה ההסקה תהיה מהירה יותר.

            שימו לב: בהרצה הראשונה של המודל לאחר הפעלת השרת המקומי, ההסקה איטית יותר, אך עם התקדמות היצירה ההסקה מאיצה, בשל כך שחלק מהמומחים שכבר היו בשימוש כבר נמצאים במטמון המהיר יותר מה-SSD.

            SparkMoE תומך בכל הפונקציונליות הקיימת של פרוייקט llama.cpp המקורי, כמו MTP, שרת OpenAI מקומי ועוד.
            כמו כן, SparkMoE תומך גם במודלים צפופים רגילים, לא רק במודלי MoE, אבל במודלים רגילים ההסקה היא רק בגודל מודל סטנדרטי.

            אופן ההרצה:

            כדי להריץ מודל גדול עם SparkMoE, יש להפעיל את התוכנה, ובממשק הדשבורד המופיע בדפדפן יש לבחור (בהפעלה הראשונה) בתיקיית מודלים (גם תתי-תיקיות נתמכות, כך שאפשר להשתמש בתיקיית Models של LM Studio), לבחור מודל, ואז ללחוץ על "הפעל מודל". להמתין לטעינת המודל עד שכפתור "פתיחת הצ'אט" נהיה זמין.
            בלחיצה על "פתיחת הצ'אט", ייפתח בכרטיסיה חדשה בדפדפן ממשק הצ'אט של SparkMoE.
            בממשק הצ'אט ניתן לשנות הגדרות רבות, כמו MTP, הודעת מערכת, פרמטרי הסקה ועוד, בלשונית "הגדרות". ניתן גם להגדיר רמת חשיבה.


            תמונות לדוגמה:

            ניהול השרת:
            6d7ef604-32e0-4b68-8f6c-773ccdb6559b-image.jpeg

            ממשק הצ'אט והגדרות ההסקה:
            f5f0944b-c2e3-4392-a1b9-f21faeea4b72-image.jpeg


            מודלים תואמים מומלצים:

            כרגע עדיין אסור ע"פ חוקי הפורום להעלות מודלי AI באופן ישיר בשל "פריצת סינונים", אבל מצורפים כמה קישורים עבור מודלי MoE בגודל בינוני, במידה והם פתוחים בסינון המותקן אצלכם:

            • Qwen 3.6 35B A3B MTP
            • Gemma 4 26B A4B

            מומלץ להוריד את קוונטיזציית Q4 של כל מודל, או IQ4 אם קיים.
            אם החומרה שברשותכם בעלת 32 GB RAM ומעלה, אפשר להתקדם למודלי MoE גדולים יותר.

            עדכונים:

            • עדכון V0.3.0:
              תוקנה תמיכה במודל Gemma 4 26B, שיפורי מהירות בכלל מודלי MoE, ותיקוני באגים.

            הורדה:

            הפרוייקט זמין בקוד פתוח בגיטהאב, ראו כאן.
            ניתן להוריד קובץ EXE להתקנה מהירה מה-releases, או גרסת ZIP ניידת (לחלץ לתיקיה ולהפעיל את SparkMoE.exe).
            אל תשכחו לשים ⭐ במאגר בגיטהאב על הדרך!
            (הקוד המקורי של llama.cpp ברישיון MIT, והחלקים שלי תחת רישיון לא מסחרי).


            אשמח לשמוע על המהירות והביצועים של המודלים השונים על חומרות שונות, וכן לקבל משוב על התוכנה עצמה!

            T מחובר
            T מחובר
            The_Yonatan
            כתב נערך לאחרונה על ידי
            #48

            @א.מ.ד. מה המודל הכי עוצמתי לקוד וחינמי שאפשר להריץ שם? מכיר?

            י תגובה 1 תגובה אחרונה
            0
            • T The_Yonatan

              @א.מ.ד. מה המודל הכי עוצמתי לקוד וחינמי שאפשר להריץ שם? מכיר?

              י מנותק
              י מנותק
              ישראל123
              כתב נערך לאחרונה על ידי
              #49

              @The_Yonatan מה החומרה שלך?

              T תגובה 1 תגובה אחרונה
              0
              • י ישראל123

                @The_Yonatan מה החומרה שלך?

                T מחובר
                T מחובר
                The_Yonatan
                כתב נערך לאחרונה על ידי
                #50

                @ישראל123 איך בודקים?...

                ח י 2 תגובות תגובה אחרונה
                0
                • T The_Yonatan

                  @ישראל123 איך בודקים?...

                  ח מנותק
                  ח מנותק
                  חד צורבא
                  כתב נערך לאחרונה על ידי
                  #51

                  @The_Yonatan
                  הגדרות > מערכת > אודות (נמצא הכי למטה)

                  תגובה 1 תגובה אחרונה
                  0
                  • T The_Yonatan

                    @ישראל123 איך בודקים?...

                    י מנותק
                    י מנותק
                    ישראל123
                    כתב נערך לאחרונה על ידי
                    #52

                    @The_Yonatan קונטרול שיפט אסכ (מנהל המשימות)

                    תגובה 1 תגובה אחרונה
                    0
                    • י מנותק
                      י מנותק
                      ישראל123
                      כתב נערך לאחרונה על ידי
                      #53

                      3992a08b-71c3-4818-930d-e7c0ad0b3003-image.jpeg
                      0aec9600-fb62-4b7e-afca-e913a35037f4-image.jpeg

                      T תגובה 1 תגובה אחרונה
                      0
                      • י ישראל123

                        3992a08b-71c3-4818-930d-e7c0ad0b3003-image.jpeg
                        0aec9600-fb62-4b7e-afca-e913a35037f4-image.jpeg

                        T מחובר
                        T מחובר
                        The_Yonatan
                        כתב נערך לאחרונה על ידי
                        #54

                        @ישראל123 14762315-da8e-4a16-b2f7-229b19c6d066-image.jpeg
                        e3f581f1-e93b-4c3e-9058-2df0dac8e409-image.jpeg
                        6d176dbc-b37b-42ca-97f4-852f773cad07-image.jpeg

                        י תגובה 1 תגובה אחרונה
                        0
                        • T The_Yonatan

                          @ישראל123 14762315-da8e-4a16-b2f7-229b19c6d066-image.jpeg
                          e3f581f1-e93b-4c3e-9058-2df0dac8e409-image.jpeg
                          6d176dbc-b37b-42ca-97f4-852f773cad07-image.jpeg

                          י מנותק
                          י מנותק
                          ישראל123
                          כתב נערך לאחרונה על ידי
                          #55

                          @The_Yonatan חומרה חלשה מאוד!
                          לי יש 12 ראם והרצתי את ג'אמה 4 הכי קטן והוא עדיין איטי מאוד
                          את מה ש @א.מ.ד. הציע לא הצלחתי בינתיים

                          תגובה 1 תגובה אחרונה
                          0
                          • א.מ.ד.א א.מ.ד.

                            SparkMoE

                            SparkMoE.png

                            בהשראת הפרויקט שהוזכר כאן ע"י @המלאך - בשם colibri, שבו קבוצת חוקרים הצליחו להריץ את המודל העוצמתי GLM 5.2 על חומרה ביתית, עם כמה עשרות GB RAM "בלבד" (לצורך ההרצה נטו נצרכו כ-25 RAM), החלטתי ליצור פרויקט דומה אך שונה, שיתאים לחומרה חלשה באמת ויריץ מודלי MoE בגודל בינוני, כמו Qwen 3.6 35B A3B ו-Gemma 4 26B A4B, במכשירים עם 8/16 GB RAM (לא נבדק על 8 RAM, אבל אמור לעבוד באותה מידה).
                            לכאורה זה אמור להתאים גם להרצת מודלי MoE גדולים מאוד של מאות B פרמטרים על חומרה בינונית (32 GB RAM ומעלה), אבל לצערי אין לי חומרה כזו כך שאין לי איך לנסות אם זה באמת עובד...

                            הרעיון המרכזי שעומד מאחורי הפרויקט הוא השארת המודל המלא על ה-SSD (כונן האחסון), וטעינת ופריקת מומחי ה-MoE באופן דינמי ל-RAM לפי הצורך. זה מאפשר הרצת מודלים בינוניים (20-40B פרמטרים) על גבי מכשירים עם RAM צרכני קלאסי, אף ללא GPU, מכיון שלא מתבצעת טעינה מלאה של כלל המודל ל-RAM.

                            כרגע הצלחתי להגיע ב-SparkMoE במודל Qwen 3.6 35B A3B עם MTP מופעל לבערך 4 טוקנים לשניה - איטי אבל שמיש. בגרסאות הבאות בעז"ה אני אנסה להאיץ ככל האפשר את ההסקה.
                            המהירות תלויה במהירות הקריאה מה-SSD, מספר ליבות ושרשורי מעבד, רוחב פס ועוד, לכן במחשב שמצטיין באלה ההסקה תהיה מהירה יותר.

                            שימו לב: בהרצה הראשונה של המודל לאחר הפעלת השרת המקומי, ההסקה איטית יותר, אך עם התקדמות היצירה ההסקה מאיצה, בשל כך שחלק מהמומחים שכבר היו בשימוש כבר נמצאים במטמון המהיר יותר מה-SSD.

                            SparkMoE תומך בכל הפונקציונליות הקיימת של פרוייקט llama.cpp המקורי, כמו MTP, שרת OpenAI מקומי ועוד.
                            כמו כן, SparkMoE תומך גם במודלים צפופים רגילים, לא רק במודלי MoE, אבל במודלים רגילים ההסקה היא רק בגודל מודל סטנדרטי.

                            אופן ההרצה:

                            כדי להריץ מודל גדול עם SparkMoE, יש להפעיל את התוכנה, ובממשק הדשבורד המופיע בדפדפן יש לבחור (בהפעלה הראשונה) בתיקיית מודלים (גם תתי-תיקיות נתמכות, כך שאפשר להשתמש בתיקיית Models של LM Studio), לבחור מודל, ואז ללחוץ על "הפעל מודל". להמתין לטעינת המודל עד שכפתור "פתיחת הצ'אט" נהיה זמין.
                            בלחיצה על "פתיחת הצ'אט", ייפתח בכרטיסיה חדשה בדפדפן ממשק הצ'אט של SparkMoE.
                            בממשק הצ'אט ניתן לשנות הגדרות רבות, כמו MTP, הודעת מערכת, פרמטרי הסקה ועוד, בלשונית "הגדרות". ניתן גם להגדיר רמת חשיבה.


                            תמונות לדוגמה:

                            ניהול השרת:
                            6d7ef604-32e0-4b68-8f6c-773ccdb6559b-image.jpeg

                            ממשק הצ'אט והגדרות ההסקה:
                            f5f0944b-c2e3-4392-a1b9-f21faeea4b72-image.jpeg


                            מודלים תואמים מומלצים:

                            כרגע עדיין אסור ע"פ חוקי הפורום להעלות מודלי AI באופן ישיר בשל "פריצת סינונים", אבל מצורפים כמה קישורים עבור מודלי MoE בגודל בינוני, במידה והם פתוחים בסינון המותקן אצלכם:

                            • Qwen 3.6 35B A3B MTP
                            • Gemma 4 26B A4B

                            מומלץ להוריד את קוונטיזציית Q4 של כל מודל, או IQ4 אם קיים.
                            אם החומרה שברשותכם בעלת 32 GB RAM ומעלה, אפשר להתקדם למודלי MoE גדולים יותר.

                            עדכונים:

                            • עדכון V0.3.0:
                              תוקנה תמיכה במודל Gemma 4 26B, שיפורי מהירות בכלל מודלי MoE, ותיקוני באגים.

                            הורדה:

                            הפרוייקט זמין בקוד פתוח בגיטהאב, ראו כאן.
                            ניתן להוריד קובץ EXE להתקנה מהירה מה-releases, או גרסת ZIP ניידת (לחלץ לתיקיה ולהפעיל את SparkMoE.exe).
                            אל תשכחו לשים ⭐ במאגר בגיטהאב על הדרך!
                            (הקוד המקורי של llama.cpp ברישיון MIT, והחלקים שלי תחת רישיון לא מסחרי).


                            אשמח לשמוע על המהירות והביצועים של המודלים השונים על חומרות שונות, וכן לקבל משוב על התוכנה עצמה!

                            א מנותק
                            א מנותק
                            אריאלל
                            כתב נערך לאחרונה על ידי
                            #56

                            @א.מ.ד. הוא מותאם גם למחשבים בעלי כרטיס גרפי או שהוא מוגדר לטעון לזיכרון ראם דווקא?

                            תגובה 1 תגובה אחרונה
                            0
                            • פ מנותק
                              פ מנותק
                              פתרון AI
                              כתב נערך לאחרונה על ידי
                              #57

                              לכזה מחשב איזה מודל אפשר להריץ
                              472b3cc3-f5bb-4fb7-bd1a-dc3a279e5a6a-image.jpeg

                              תגובה 1 תגובה אחרונה
                              0

                              שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

                              נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

                              בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

                              הרשמה התחברות

                              • התחברות

                              • אין לך חשבון עדיין? הרשמה

                              • התחברו או הירשמו כדי לחפש.
                              • פוסט ראשון
                                פוסט אחרון
                              0
                              • חוקי הפורום
                              • פופולרי
                              • לא נפתר
                              • משתמשים
                              • חיפוש גוגל בפורום
                              • צור קשר