שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬
-
DeepSeek - DeepSeek V4 Flash 0731
רעידת אדמה נוספת בעולם ה-AI:
DeepSeek מוציאה את מודל ה-V4 Flash שלה מתצוגה מקדימה, ומשיקה את המודל הסופי והרשמי: DeepSeek V4 Flash 0731.
המודל החדש עולה על גרסת התצוגה המקדימה של V4 Pro, ועוקף אפילו את GLM 5.2 האגדי, או לפחות משתווה לו, למרות שהוא רק כשליש מגודלו.
המודל השתפר משמעותית בכל המדדים, בפרט במשימות סוכניות, וייתכן שאנו חווים כרגע את "רגע DeepSeek 2"...


לפי DeepSeek, הם מתכננים להשיק בקרוב גם את הגרסה הרשמית של DeepSeek V4 Pro.
קישור:
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 -
@CSS-0 ייתכן.
אבל איך שמרתם סשן שם?המלאך כתב:
אני לא הצלחתי לשמור סשן בקאגל עצמו למרות שרשמית זה אחד הפלוסים העיקריים שלהם על קולאב.
עיין כאן: https://tchumim.com/topic/17538/הגדרת-שמירת-נתונים-בקאגל -
-
-
-
פיצ'ר שבהתחלה היה פתוח לחלוטין בנטפרי, וכרגע עובד חלקית בלבד..
בדיוק כמו 'שאל את ג'מיני' ביוטיוב, שהיה פתוח גורף עד לפני שבוע, שעלו על זה וסגרו אותו לחלוטין.
ובטווח הרחוק יותר - ג'מיני בגוגל פיננס שעבר בדיוק אותו תהליך.
למרות ששניהם שימושיים מאד, ולא נראה שנטפרי מתכננים לפתוח את זה בצורה מוגבלת מתי שהוא.) -
-
-
פיצ'ר שבהתחלה היה פתוח לחלוטין בנטפרי, וכרגע עובד חלקית בלבד..
בדיוק כמו 'שאל את ג'מיני' ביוטיוב, שהיה פתוח גורף עד לפני שבוע, שעלו על זה וסגרו אותו לחלוטין.
ובטווח הרחוק יותר - ג'מיני בגוגל פיננס שעבר בדיוק אותו תהליך.
למרות ששניהם שימושיים מאד, ולא נראה שנטפרי מתכננים לפתוח את זה בצורה מוגבלת מתי שהוא.)ולא נראה שנטפרי מתכננים לפתוח את זה בצורה מוגבלת מתי שהוא.)
את הסוכן של גוגל אין דרך לפתוח, המחשב הווירטואלי רץ על השרתים של גוגל.. (לפי מה שאני מבין)
-
@חיים-שנקר דרך אגב יש לך ניסיון עם קאגל?
אני לא הצלחתי לשמור סשן בקאגל עצמו למרות שרשמית זה אחד הפלוסים העיקריים שלהם על קולאב.
עיין כאן: https://tchumim.com/topic/17538/הגדרת-שמירת-נתונים-בקאגלאני לא הצלחתי לשמור סשן בקאגל עצמו למרות שרשמית זה אחד הפלוסים העיקריים שלהם על קולאב.
בגלל שהרצת מהדף עצמו, ואז זה נסגר כשאתה סוגר.
אתה צריך לכתוב/לערוך את המחברת, לצאת, ואז השמירה מפעילה את המחברת אוטומטית, כשהתוצרים נשמרים (אא״כ כתבת אותם לtemp).
בכל מקרה, אתה יכול להתקין את חבילת הפייתון שלהם, ולבקש מהai להריץ לך, הוא וודאי יסתדר עם זה.... -
אני לא הצלחתי לשמור סשן בקאגל עצמו למרות שרשמית זה אחד הפלוסים העיקריים שלהם על קולאב.
בגלל שהרצת מהדף עצמו, ואז זה נסגר כשאתה סוגר.
אתה צריך לכתוב/לערוך את המחברת, לצאת, ואז השמירה מפעילה את המחברת אוטומטית, כשהתוצרים נשמרים (אא״כ כתבת אותם לtemp).
בכל מקרה, אתה יכול להתקין את חבילת הפייתון שלהם, ולבקש מהai להריץ לך, הוא וודאי יסתדר עם זה.... -
@א.מ.ד. איך מורידים ומתי יהיה זמין
מהקישור שהבאתי בפוסט...
אבל מן הסתם זה לא רלוונטי לחומרה שלך...הוא כתב בשרשור הזה, לא השני, מה הבעיה?
-
@א.מ.ד. איך מורידים ומתי יהיה זמין
מהקישור שהבאתי בפוסט...
אבל מן הסתם זה לא רלוונטי לחומרה שלך...הוא כתב בשרשור הזה, לא השני, מה הבעיה?
-
@המלאך אני כמעט בטוח שאכן כך.
-
@המלאך @חיים-שנקר
אז ככה: בחרתי ב-Qwen 3 מכיון שהוא הכי חדש ועדכני, תומך בעברית באופן מלא (למרות שגרסת מודל השפה המקבילה שלו ממש לא), קטן ומהיר (עיבוד שאילתא לוקח פחות משניה על CPU בכימות Q4).
את מערך נתוני האימון יצרתי באופן חצי סינטטי (שרפתי מכסה של שבועיים שלמים בקודקס), והוא כולל גם שאלות ותשובות וגם חיפוש סמנטי.
אחרי האימון אמנם היתה קפיצה עצומה ביכולות התאמת תשובה לשאילתת חיפוש, ברמה שלטעמי כבר מוכנה לשילוב באוצריא במקביל לחיפוש הרגיל, אבל נכון לעכשיו עדיין זה לא 100%, כי עדיין אין מודל מספיק טוב בעברית בגודל שמתאים לחומרה חלשה.
אני שוקל אולי לאמן מאפס מודל הטמעה המבוסס על כל אוצריא, אבל זה כבר ידרוש תקציב מסוים.@א.מ.ד. @המלאך @css-0 רק בשביל ההמחשה לרעיון שלי ביקשתי סיכום מGPT עבור מה אפשר לנצל מספריא עבור מודל הטמעה - לא בדקתי אפילו
בקיצור, עבור מודל הטמעה (Embedding) לעברית תורנית, מספריא כדאי לנצל בעיקר את שכבת הקשרים ולא רק את הטקסטים עצמם. ספריא מספקת גם טקסטים וגם מבנה של קשרים בין מקורות. (Sefaria)
הדברים החשובים ביותר:
1. קישורי מקורות (Links)





להפוך לקשרי אימון:
פסוק ↓ רש"י ↓ רמב"ן ↓ מדרששימוש:
- Positive pairs לאימון contrastive learning
- הבנת "איזה מקורות קשורים"
(Sefaria)
2. פירושים (Commentaries)





ליצור קשר:
טקסט בסיס + פירוש עליו = קרבה סמנטית חזקהלדוגמה:
- תנ"ך
רש"י - גמרא
תוספות - משנה
מפרשים
3. Topics / נושאים




להוסיף שכבת משמעות:
קטע ↓ נושא ↓ קטעים נוספים באותו נושאלדוגמה:
שמיטה ├─ ויקרא ├─ משנה שביעית ├─ רמב"ם └─ שו"ת(Sefaria)
4. Sheets (דפי מקורות)




מקורות שאנשים כבר קיבצו יחד:
מקור א מקור ב מקור גזה Dataset טבעי של "מקורות קרובים".
5. ציטוטים והפניות (Citations)




ללמד את המודל:
ספר מאוחר ↓ מצטט ↓ מקור קדוםלדוגמה:
שו"ת ↔ תלמוד(Sefaria)
6. מטא־דאטה



להכניס לכל embedding:
{ book:"", author:"", period:"", category:"", language:"", topics:[] }זה יעזור למודל להבדיל בין:
- הלכה
- אגדה
- פרשנות
- מדרש
- קבלה וכו'.
Dataset שהייתי בונה:
sefaria_embedding/ texts.jsonl links.jsonl commentaries.jsonl topics.jsonl sheets.jsonl citations.jsonl metadata.jsonl
סוגי זוגות אימון:
זוג חיובי:
רמב"ן בראשית א ↔ רש"י בראשית אזוג נושאי:
הלכות שבת רמב"ם ↔ מסכת שבתזוג ציטוט:
שו"ת אחרון ↔ מקור בגמראשלילי:
הלכות שבת ↔ הלכות עירובין רחוקות
אם מדרגים חשיבות למודל embedding:
Links
Commentaries
Topics- Sheets
- Citations
- Metadata
החלק הייחודי של ספריא הוא שהמודל לא ילמד רק "מילים דומות", אלא מבנה של קשרי לימוד תורניים.
-
@א.מ.ד. @המלאך @css-0 רק בשביל ההמחשה לרעיון שלי ביקשתי סיכום מGPT עבור מה אפשר לנצל מספריא עבור מודל הטמעה - לא בדקתי אפילו
בקיצור, עבור מודל הטמעה (Embedding) לעברית תורנית, מספריא כדאי לנצל בעיקר את שכבת הקשרים ולא רק את הטקסטים עצמם. ספריא מספקת גם טקסטים וגם מבנה של קשרים בין מקורות. (Sefaria)
הדברים החשובים ביותר:
1. קישורי מקורות (Links)





להפוך לקשרי אימון:
פסוק ↓ רש"י ↓ רמב"ן ↓ מדרששימוש:
- Positive pairs לאימון contrastive learning
- הבנת "איזה מקורות קשורים"
(Sefaria)
2. פירושים (Commentaries)





ליצור קשר:
טקסט בסיס + פירוש עליו = קרבה סמנטית חזקהלדוגמה:
- תנ"ך
רש"י - גמרא
תוספות - משנה
מפרשים
3. Topics / נושאים




להוסיף שכבת משמעות:
קטע ↓ נושא ↓ קטעים נוספים באותו נושאלדוגמה:
שמיטה ├─ ויקרא ├─ משנה שביעית ├─ רמב"ם └─ שו"ת(Sefaria)
4. Sheets (דפי מקורות)




מקורות שאנשים כבר קיבצו יחד:
מקור א מקור ב מקור גזה Dataset טבעי של "מקורות קרובים".
5. ציטוטים והפניות (Citations)




ללמד את המודל:
ספר מאוחר ↓ מצטט ↓ מקור קדוםלדוגמה:
שו"ת ↔ תלמוד(Sefaria)
6. מטא־דאטה



להכניס לכל embedding:
{ book:"", author:"", period:"", category:"", language:"", topics:[] }זה יעזור למודל להבדיל בין:
- הלכה
- אגדה
- פרשנות
- מדרש
- קבלה וכו'.
Dataset שהייתי בונה:
sefaria_embedding/ texts.jsonl links.jsonl commentaries.jsonl topics.jsonl sheets.jsonl citations.jsonl metadata.jsonl
סוגי זוגות אימון:
זוג חיובי:
רמב"ן בראשית א ↔ רש"י בראשית אזוג נושאי:
הלכות שבת רמב"ם ↔ מסכת שבתזוג ציטוט:
שו"ת אחרון ↔ מקור בגמראשלילי:
הלכות שבת ↔ הלכות עירובין רחוקות
אם מדרגים חשיבות למודל embedding:
Links
Commentaries
Topics- Sheets
- Citations
- Metadata
החלק הייחודי של ספריא הוא שהמודל לא ילמד רק "מילים דומות", אלא מבנה של קשרי לימוד תורניים.
-
@חיים-שנקר מודל קטן לא יכול לקלוט את הקשר הסמנטי בין קטע תורני לנושאי כלים שעליו. רק מודל גדול ברמת ג'מיני אמבדינג שמבין היטב את המשמעות ומודע מראש להקשרים.
-
@א.מ.ד. אז לאיזה רמה אימנת את המודל שלך והאם זוגות חיובים ושלילים יותר ברורים מפירוש על פסוק\גמרא\משנה
@א.מ.ד. אז לאיזה רמה אימנת את המודל שלך
מה הכוונה?
והאם זוגות חיובים ושלילים יותר ברורים מפירוש על פסוק\גמרא\משנה
בהחלט... יש הקשר סמנטי ברור.
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות

) אי אפשר לשמור גירסה בזמן ריצה..