שיתוף | מה חדש בבינה מלאכותית - נספח עדכוני פיצ'רים ודיונים 💬
-
@חיים-שנקר מה הבעיה במודל Otzaria-Embedding-V1-Flash-0.6B?
-
הרגע שבו נמאס לבנ"א מכמויות הראם של הai.
אז הוא נתן לו תקציב של שני ג'יגה.
פשוט תקראו את הרדמי ותהנו.https://github.com/drumih/turbo-fieldfare
כמובן שזה רק למק..
-
@חיים-שנקר אני לא רוצה לגנוב לו הישגים,
אזן @א.מ.ד. אולי תשתף אותנו
הוא בחר qwen כי הוא היה מודל הטמעה, משא"כ ברל שלא, והיה צריך ללמד אותו להחזיר קישורים, אני דווקא רציתי Berel אבל לא היה מספיק דאטה..
-
מי אמר שאופוס 5 חסכני בטוקנים?

-
@חיים-שנקר אני לא רוצה לגנוב לו הישגים,
אזן @א.מ.ד. אולי תשתף אותנו
הוא בחר qwen כי הוא היה מודל הטמעה, משא"כ ברל שלא, והיה צריך ללמד אותו להחזיר קישורים, אני דווקא רציתי Berel אבל לא היה מספיק דאטה..
-
@המלאך אבל זה בדיוק היה ההצעה שלי לקחת את BEREL שמותאם לעברית תורנית ולנצל את הרעיון של קישורים פירושים וכו' וכו' שקיים כבר באוצריא\ספריא כדי ליצור זוגות חיוביים ושליליים - האם זה לא מספיק דאטה?
@חיים-שנקר תשובות יש.
אבל שאלות מנלן? שאילתות חיפוש.. -
@חיים-שנקר תשובות יש.
אבל שאלות מנלן? שאילתות חיפוש.. -
@המלאך אסביר אני לא מחפש מודל הטמעה עבור שו"ת אלא עבור חיפוש סמנטי שזה אומר גם תוצאה שקרובה מבחינה רעיונית והקשר תוחזר [ גם אם לא מופיעים המילים המדויקות ] ולזה מספיק שהמודל לומד למשל שפירוש רשי הוא קרוב לפסוק וכו'
-
גוגל חיברה את מחולל התמונות Nano Banana שלה ל-Google Earth, ומאפשרת למשתמשים ליצור שחזורים של אתרים היסטוריים באמצעות בינה מלאכותית ולדגמן פרויקטים של נדל"ן.
-
גוגל חיברה את מחולל התמונות Nano Banana שלה ל-Google Earth, ומאפשרת למשתמשים ליצור שחזורים של אתרים היסטוריים באמצעות בינה מלאכותית ולדגמן פרויקטים של נדל"ן.
-
@חיים-שנקר אני אתן ל @א.מ.ד. להסביר..
ככה אני טענתי בהתחלה..
רק אומר שמבחן המציאות זה לא עבד.@המלאך @חיים-שנקר
אז ככה: בחרתי ב-Qwen 3 מכיון שהוא הכי חדש ועדכני, תומך בעברית באופן מלא (למרות שגרסת מודל השפה המקבילה שלו ממש לא), קטן ומהיר (עיבוד שאילתא לוקח פחות משניה על CPU בכימות Q4).
את מערך נתוני האימון יצרתי באופן חצי סינטטי (שרפתי מכסה של שבועיים שלמים בקודקס), והוא כולל גם שאלות ותשובות וגם חיפוש סמנטי.
אחרי האימון אמנם היתה קפיצה עצומה ביכולות התאמת תשובה לשאילתת חיפוש, ברמה שלטעמי כבר מוכנה לשילוב באוצריא במקביל לחיפוש הרגיל, אבל נכון לעכשיו עדיין זה לא 100%, כי עדיין אין מודל מספיק טוב בעברית בגודל שמתאים לחומרה חלשה.
אני שוקל אולי לאמן מאפס מודל הטמעה המבוסס על כל אוצריא, אבל זה כבר ידרוש תקציב מסוים. -
@המלאך @חיים-שנקר
אז ככה: בחרתי ב-Qwen 3 מכיון שהוא הכי חדש ועדכני, תומך בעברית באופן מלא (למרות שגרסת מודל השפה המקבילה שלו ממש לא), קטן ומהיר (עיבוד שאילתא לוקח פחות משניה על CPU בכימות Q4).
את מערך נתוני האימון יצרתי באופן חצי סינטטי (שרפתי מכסה של שבועיים שלמים בקודקס), והוא כולל גם שאלות ותשובות וגם חיפוש סמנטי.
אחרי האימון אמנם היתה קפיצה עצומה ביכולות התאמת תשובה לשאילתת חיפוש, ברמה שלטעמי כבר מוכנה לשילוב באוצריא במקביל לחיפוש הרגיל, אבל נכון לעכשיו עדיין זה לא 100%, כי עדיין אין מודל מספיק טוב בעברית בגודל שמתאים לחומרה חלשה.
אני שוקל אולי לאמן מאפס מודל הטמעה המבוסס על כל אוצריא, אבל זה כבר ידרוש תקציב מסוים. -
@א.מ.ד. מודל הטמעה נועד בשביל לדייק את החיפוש.
זה לא יעזור כשמדובר בדיוק באחוזים כאלה.
הוא יהיה טוב לתוצאות עברו.
לפחות מבחינת השאילתות..
תחשוב אם 100 ספרים נוספים יכנסו..@המלאך נכון, אבל מודל שקרא מספיק טקסט תורני מכל הסוגים (5.5GB אאל"ט נכון?), יבין מצויין את כל הספרות התורנית שתוסיף לו בשנים הקרובות, בדיוק כמו שמודל שפה שאומן על מערך נתונים עצום, גדול ככל שיהיה, מבין מצויין מה שתדבר איתו למרות שזה לא מופיע במערך.
-
@המלאך נכון, אבל מודל שקרא מספיק טקסט תורני מכל הסוגים (5.5GB אאל"ט נכון?), יבין מצויין את כל הספרות התורנית שתוסיף לו בשנים הקרובות, בדיוק כמו שמודל שפה שאומן על מערך נתונים עצום, גדול ככל שיהיה, מבין מצויין מה שתדבר איתו למרות שזה לא מופיע במערך.
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות
