@א.מ.ד. האם יש סיכוי שהמאגר והמודל ישוחררו לציבור?
חיים שנקר
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬 -
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@א.מ.ד. מרשים כמה גודל מאגר הזוגות - ולמה לדעתך זה לא יצא מספיק טוב - האם זה תלוי בגודל מודל הבסיס - מה שאומר שאפשר אולי לנסות מודלים מעט גדולים יותר
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@א.מ.ד. התכוונתי לאיזה רמה של חיפוש סמנטי ? - אבל אם הזוגות יותר ברורים בהקשר מפירוש אז זה גם התשובה - אבל מעניין לבדוק את זה האם מודל קטן לא יכול ללמוד הקשר כזה
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@א.מ.ד. אז לאיזה רמה אימנת את המודל שלך והאם זוגות חיובים ושלילים יותר ברורים מפירוש על פסוק\גמרא\משנה
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@א.מ.ד. @המלאך @css-0 רק בשביל ההמחשה לרעיון שלי ביקשתי סיכום מGPT עבור מה אפשר לנצל מספריא עבור מודל הטמעה - לא בדקתי אפילו
בקיצור, עבור מודל הטמעה (Embedding) לעברית תורנית, מספריא כדאי לנצל בעיקר את שכבת הקשרים ולא רק את הטקסטים עצמם. ספריא מספקת גם טקסטים וגם מבנה של קשרים בין מקורות. (Sefaria)
הדברים החשובים ביותר:
1. קישורי מקורות (Links)





להפוך לקשרי אימון:
פסוק ↓ רש"י ↓ רמב"ן ↓ מדרששימוש:
- Positive pairs לאימון contrastive learning
- הבנת "איזה מקורות קשורים"
(Sefaria)
2. פירושים (Commentaries)





ליצור קשר:
טקסט בסיס + פירוש עליו = קרבה סמנטית חזקהלדוגמה:
- תנ"ך
רש"י - גמרא
תוספות - משנה
מפרשים
3. Topics / נושאים




להוסיף שכבת משמעות:
קטע ↓ נושא ↓ קטעים נוספים באותו נושאלדוגמה:
שמיטה ├─ ויקרא ├─ משנה שביעית ├─ רמב"ם └─ שו"ת(Sefaria)
4. Sheets (דפי מקורות)




מקורות שאנשים כבר קיבצו יחד:
מקור א מקור ב מקור גזה Dataset טבעי של "מקורות קרובים".
5. ציטוטים והפניות (Citations)




ללמד את המודל:
ספר מאוחר ↓ מצטט ↓ מקור קדוםלדוגמה:
שו"ת ↔ תלמוד(Sefaria)
6. מטא־דאטה



להכניס לכל embedding:
{ book:"", author:"", period:"", category:"", language:"", topics:[] }זה יעזור למודל להבדיל בין:
- הלכה
- אגדה
- פרשנות
- מדרש
- קבלה וכו'.
Dataset שהייתי בונה:
sefaria_embedding/ texts.jsonl links.jsonl commentaries.jsonl topics.jsonl sheets.jsonl citations.jsonl metadata.jsonl
סוגי זוגות אימון:
זוג חיובי:
רמב"ן בראשית א ↔ רש"י בראשית אזוג נושאי:
הלכות שבת רמב"ם ↔ מסכת שבתזוג ציטוט:
שו"ת אחרון ↔ מקור בגמראשלילי:
הלכות שבת ↔ הלכות עירובין רחוקות
אם מדרגים חשיבות למודל embedding:
Links
Commentaries
Topics- Sheets
- Citations
- Metadata
החלק הייחודי של ספריא הוא שהמודל לא ילמד רק "מילים דומות", אלא מבנה של קשרי לימוד תורניים.
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך למה לא תיצור מחברת תוריד ותעלה - שתיהם בסביבת לינוקס - פייתון
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך אז אפשר לבנות מחברת בקולאב ולייבא לקאגל - ולTPU הם דורשים אימות פנים [אמיתי] - תנסה להגיש בקשה בצד ימין לTPU
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך כמה גישה ולכמה זמן כי ב kaggle יש גישה בחשבונות מאומתים לtpu
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬 -
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך אסביר אני לא מחפש מודל הטמעה עבור שו"ת אלא עבור חיפוש סמנטי שזה אומר גם תוצאה שקרובה מבחינה רעיונית והקשר תוחזר [ גם אם לא מופיעים המילים המדויקות ] ולזה מספיק שהמודל לומד למשל שפירוש רשי הוא קרוב לפסוק וכו'
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך אבל זה בדיוק היה ההצעה שלי לקחת את BEREL שמותאם לעברית תורנית ולנצל את הרעיון של קישורים פירושים וכו' וכו' שקיים כבר באוצריא\ספריא כדי ליצור זוגות חיוביים ושליליים - האם זה לא מספיק דאטה?
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬 -
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@המלאך זה סקופ היכן ואיפה אפשר לראות אותו - וגם היכן ניתן לראות את הארכיקטורה שלו אולי אפשר לנסות להציע רעיונות לשיפור
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@CSS-0 הקנייטש לאימון הוא להפוך אותו באמצעות זוגות חיובים ושליליים למודל הטמעה המותאם לחיפוש סמנטי עבור אינדקס וקטורי
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@CSS-0 המעלה של BEREL שהוא הותאם כבר לעברית תורנית בדיוק מהמאגר הזה
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬 -
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@CSS-0 אני מדבר על מודל הטמעה כדי ליצור אינדקס לחיפוש וקטורי
-
שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬@CSS-0 אם כזה מחשב אולי הפרויקט הבא מתאים לך - הצעה למודל AI עבור חיפוש סמנטי - כידוע יש באוצריא מבנה של פירושים וקישורים וכו' שיכול לאפשר לכוונן מודל קיים כמו ברל 3 של דיקטא על המאגר באופן שינתן דירוג התאמה לתרגום\פירוש\קישור\מקורות\ציטוטים [לא יודע האם הכל קיים בDB של אוצריא אולי רק במקור בספריא ]וליצור זוגות חיובים ושלילים וכמובן לחלק את זה לפי פסקאות \קטעים וכו' ויהיה לנו מודל הטמעה נהדר לאינדוקס וקטורי עבר חיפוש סמנטי לעברית תורנית
-
להורדה | שרת MCP עבור מודלי AI, בפרט מקומיים, עבור קריאה וחיפוש מלאים בקבצי ZIM כדוגמת המכלול וויקיפדיה! גרסה V1.0.3@א.מ.ד. אולי גם עבור DB כמו של זית ואוצריא
-
בירור | OCR לזית, המשך@לא-מתייאש אולי אפשר להמיר ספרים לטקסט באמצעות OCR אבל לשמור את הגופן או גופן קרוב לזה [עם הגדרות כמה האותיות שבורות
] והגדרות צורת הדף של הספר המקורי ולהשתמש בזה כדדי לאפשר צורת הדף המקורית - מה שיתן תחושה קרובה למקור