בקשת מידע | בניית תוכנה שלימה עם AI
-
נראה שיש פה קצת שיח חרשים, בזמן ש @לא-מתייאש טוען טענות טכניות במבט מיקרו, ואילו @המלאך ו @nh.local טוענים טענות במאקרו באופן כללי.
מה שטענו לא הודה לו, ומה שהודה לו לא טענו. -
-
@NH.LOCAL ה-AI חזק מאוד במשימות ספציפיות ומוגדרות היטב: לפתור בעיה של ארדש, להציע השערה על מנגנון, לבדוק אפשרויות. שם הוא עוקף הרבה אנשים, אני לא מתווכח על זה.
אבל תסתכל על הדוגמאות שלך עצמך. אצל Unutmaz זה עבד כי הוא אימונולוג שהיו לו את הנתונים והוא יכל לשפוט אם התשובה מחזיקה מבחינה ביולוגית. בבעיות של ארדש, כל הוכחה נבדקת באופן פורמלי ב-Lean ואחר כך מאושרת ע"י טאו. בשני המקרים יש מאמת. ב-prod אין Lean שיגיד לך שהקוד נכון: המאמת זה מי שמבין את הקוד.
ופרויקט שלם זה כבר משהו אחר לגמרי. צריך לתאם מאות החלטות, לעשות את החיבורים הנכונים בין חלקים שאין ביניהם קשר, ולזכור אלפי פרטים שאתה מחליט שהם חשובים: למה נעשתה בחירה מסוימת, מה כבר נשבר, מה עלול להישבר. בזה הוא עדיין רחוק שנות אור מהמוח האנושי.
בן אדם יכול ללמוד לתכנת מספר של 50 עמודים. הוא באמת מבין מה הוא עושה, הוא יוצר, מתקן את עצמו, לומד מהטעויות שלו. ה-AI נשען על דפוסים שהוא ראה מיליארדי פעמים. זה חזק מאוד במשימות מסוימות, אבל תסתכל על דף נחיתה פשוט: כל הקוד נכנס לו בקונטקסט, ובכל זאת התוצאה מזעזעת. כל אלמנט בנפרד תקין, אבל לכלל אין שום קוהרנטיות. זה ה-slop: חוסר בראייה כוללת.
אישית, אני אפילו לא בטוח שנראה AGI
@NH.LOCAL ה-AI חזק מאוד במשימות ספציפיות ומוגדרות היטב: לפתור בעיה של ארדש, להציע השערה על מנגנון, לבדוק אפשרויות. שם הוא עוקף הרבה אנשים, אני לא מתווכח על זה.
אבל תסתכל על הדוגמאות שלך עצמך. אצל Unutmaz זה עבד כי הוא אימונולוג שהיו לו את הנתונים והוא יכל לשפוט אם התשובה מחזיקה מבחינה ביולוגית. בבעיות של ארדש, כל הוכחה נבדקת באופן פורמלי ב-Lean ואחר כך מאושרת ע"י טאו. בשני המקרים יש מאמת. ב-prod אין Lean שיגיד לך שהקוד נכון: המאמת זה מי שמבין את הקוד.
ופרויקט שלם זה כבר משהו אחר לגמרי. צריך לתאם מאות החלטות, לעשות את החיבורים הנכונים בין חלקים שאין ביניהם קשר, ולזכור אלפי פרטים שאתה מחליט שהם חשובים: למה נעשתה בחירה מסוימת, מה כבר נשבר, מה עלול להישבר. בזה הוא עדיין רחוק שנות אור מהמוח האנושי.
בן אדם יכול ללמוד לתכנת מספר של 50 עמודים. הוא באמת מבין מה הוא עושה, הוא יוצר, מתקן את עצמו, לומד מהטעויות שלו. ה-AI נשען על דפוסים שהוא ראה מיליארדי פעמים. זה חזק מאוד במשימות מסוימות, אבל תסתכל על דף נחיתה פשוט: כל הקוד נכנס לו בקונטקסט, ובכל זאת התוצאה מזעזעת. כל אלמנט בנפרד תקין, אבל לכלל אין שום קוהרנטיות. זה ה-slop: חוסר בראייה כוללת.
אתה בהחלט צודק במובנים רבים. בסוף אתר או תוכנה בנוי מאינסוף החלטות אנושיות קטנות שמכוונות את איך שהכל יראה. אני אישית לא מסתכל על קוד כבר שנים, אבל כל חלק שקשור לחווית השימוש, ההגדרות המדויקות ועוד עבר אינסוף ליטוש והיה נראה אחרת לגמרי בלי כוונון מדויק שלי.
מצד שני, זה יכול להיות נכון כי אתה רוצה מוצר "שלך" בסגנון "שלך" ובראש "שלך" (גם אני ככה) אבל אם למשל המטרה היא מוצר שימקסם את הכסף שלך, יתכן מאוד ש-AI יוכל להחליט מספיק החלטות נכונות בלי התערבות של היוצר, כי דעתו פשוט לא תשנה.
בדיוק כמו שגוגל קבעה את צבע הקישורים שלה לפי מבחני A/B ולא לפי הטעם האישי של המנכ"ל.אם תרצה דוגמה פשוטה, כתיבת רומן היא בהחלט משהו ש-AI לא פתר, ויתכן שגם לא יפתור גם אחרי שימצא תרופה לסרטן. אבל זו בעית ארכיקטורה וסביר להניח שברגע שנגיע ל-ASI או RSI זה כבר יפתר ממילא עם גילוי שיטות חדשות ויעילות יותר לזיכרון לטווח בינוני וארוך.
לגבי בעיות המתמטיקה, אתה קצת מפשט (בלשון המעטה) את מה שכלול בפתרון הנאוויה סטוקס או בעיות ארדוש. זה לא סתם "בוא נמצא את הפתרון", אלא תיאום מורכב ועצום בין אינסוף נקודות וחלקים.
זה בהחלט נכנס להגדרה של "צריך לתאם מאות החלטות, לעשות את החיבורים הנכונים בין חלקים שאין ביניהם קשר, ולזכור אלפי פרטים שאתה מחליט שהם חשובים: למה נעשתה בחירה מסוימת, מה כבר נשבר, מה עלול להישבר."
הוא אכן רחוק שנות אור מהמוח האנושי, אבל לא מהכיוון שאתה חושב...אגב ראייה כוללת, חפש דוגמאות של סרטונים מבוססי קוד שקלוד אופוס 5.5 יצר, זה הרבה מעבר לראייה כוללת, זו ראייה על אנושית
אישית, אני אפילו לא בטוח שנראה AGI
לפי כל מדד של 2020, אנחנו עם AGI כבר שנים. השער פשוט זז כל הזמן, כך שהמושג שלעצמו חסר משמעות במידת מה.
אני משוכנע שאם תרצה ב-2050 להכחיש קיום של AGI, תמצא מגוון דרכים לשכנע את עצמך.
ושוב: ברגע ש-AI ישתפר באופן רקורסיבי, לכל הבעיות ימצא פתרון במהירות גבוהה בהרבה משניתן לדמיין.
אני עם @א.מ.ד. - ניפגש בתשרי תשפ"ח

-
השרשור הפך לדיון נוסף על ai?
לפחות תתנו מסקנה ל @עידו300 , כי נראה שכולם פה מסכימים שכותבים תוכנות בעזרת ai,
ומישהו מכם ייתן פה איזה פוסט ארוך ומפורט על איך בונים תוכנה כמו שצריך עם ai במקום האם צריך לעשות את זה?והאם הai ישתלט על כל התעשיות, והאם הוא יאכל אותנו, וכו'
עריכה: עברתי שוב על השרשור ויש הסברים מדהימים למעלה, אבל למה לא פתחתם שרשור נפרד לדיון?
-
השרשור הפך לדיון נוסף על ai?
לפחות תתנו מסקנה ל @עידו300 , כי נראה שכולם פה מסכימים שכותבים תוכנות בעזרת ai,
ומישהו מכם ייתן פה איזה פוסט ארוך ומפורט על איך בונים תוכנה כמו שצריך עם ai במקום האם צריך לעשות את זה?והאם הai ישתלט על כל התעשיות, והאם הוא יאכל אותנו, וכו'
עריכה: עברתי שוב על השרשור ויש הסברים מדהימים למעלה, אבל למה לא פתחתם שרשור נפרד לדיון?
-
@yeo4 סלח לי על השאלה אבל אתה בכלל קראת את התגובה שלי?
@לא-מתייאש טען מפורשות שAI טוב בלפתור בעיות ספציפיות ואני עניתי לו שזה נכון ללפני שנה.
איפה אתה רואה פה מיקרו ומאקרו? -
השרשור הפך לדיון נוסף על ai?
לפחות תתנו מסקנה ל @עידו300 , כי נראה שכולם פה מסכימים שכותבים תוכנות בעזרת ai,
ומישהו מכם ייתן פה איזה פוסט ארוך ומפורט על איך בונים תוכנה כמו שצריך עם ai במקום האם צריך לעשות את זה?והאם הai ישתלט על כל התעשיות, והאם הוא יאכל אותנו, וכו'
עריכה: עברתי שוב על השרשור ויש הסברים מדהימים למעלה, אבל למה לא פתחתם שרשור נפרד לדיון?
-
@שלץ העניין הוא שאתה מצפה למשהו לא הגיוני.
זה דבר שתלוי בטעם אישי, לכל אחד יש את השיטות שלו והדרכים שלו והכלים שלו לפיתוח תוכנה עם ai.
@המלאך ברור, אבל יש בסיס.
לדעתי דווקא נתנו אותו יפה למעלה, עם פריסה יפה של מידע על כלים שונים
לכן הוספתי את ההערה, כי נראה שממה שנתנו כבר אין הרבה לאן להתקדם, אבל נראה בלי קשר לפה ספציפית שמספימים שרשורים שקשורים לai בדיונים בנושא, ואף אחד לא פותח שרשור דיונים מסודר
-
@NH.LOCAL ה-AI חזק מאוד במשימות ספציפיות ומוגדרות היטב: לפתור בעיה של ארדש, להציע השערה על מנגנון, לבדוק אפשרויות. שם הוא עוקף הרבה אנשים, אני לא מתווכח על זה.
אבל תסתכל על הדוגמאות שלך עצמך. אצל Unutmaz זה עבד כי הוא אימונולוג שהיו לו את הנתונים והוא יכל לשפוט אם התשובה מחזיקה מבחינה ביולוגית. בבעיות של ארדש, כל הוכחה נבדקת באופן פורמלי ב-Lean ואחר כך מאושרת ע"י טאו. בשני המקרים יש מאמת. ב-prod אין Lean שיגיד לך שהקוד נכון: המאמת זה מי שמבין את הקוד.
ופרויקט שלם זה כבר משהו אחר לגמרי. צריך לתאם מאות החלטות, לעשות את החיבורים הנכונים בין חלקים שאין ביניהם קשר, ולזכור אלפי פרטים שאתה מחליט שהם חשובים: למה נעשתה בחירה מסוימת, מה כבר נשבר, מה עלול להישבר. בזה הוא עדיין רחוק שנות אור מהמוח האנושי.
בן אדם יכול ללמוד לתכנת מספר של 50 עמודים. הוא באמת מבין מה הוא עושה, הוא יוצר, מתקן את עצמו, לומד מהטעויות שלו. ה-AI נשען על דפוסים שהוא ראה מיליארדי פעמים. זה חזק מאוד במשימות מסוימות, אבל תסתכל על דף נחיתה פשוט: כל הקוד נכנס לו בקונטקסט, ובכל זאת התוצאה מזעזעת. כל אלמנט בנפרד תקין, אבל לכלל אין שום קוהרנטיות. זה ה-slop: חוסר בראייה כוללת.
אתה בהחלט צודק במובנים רבים. בסוף אתר או תוכנה בנוי מאינסוף החלטות אנושיות קטנות שמכוונות את איך שהכל יראה. אני אישית לא מסתכל על קוד כבר שנים, אבל כל חלק שקשור לחווית השימוש, ההגדרות המדויקות ועוד עבר אינסוף ליטוש והיה נראה אחרת לגמרי בלי כוונון מדויק שלי.
מצד שני, זה יכול להיות נכון כי אתה רוצה מוצר "שלך" בסגנון "שלך" ובראש "שלך" (גם אני ככה) אבל אם למשל המטרה היא מוצר שימקסם את הכסף שלך, יתכן מאוד ש-AI יוכל להחליט מספיק החלטות נכונות בלי התערבות של היוצר, כי דעתו פשוט לא תשנה.
בדיוק כמו שגוגל קבעה את צבע הקישורים שלה לפי מבחני A/B ולא לפי הטעם האישי של המנכ"ל.אם תרצה דוגמה פשוטה, כתיבת רומן היא בהחלט משהו ש-AI לא פתר, ויתכן שגם לא יפתור גם אחרי שימצא תרופה לסרטן. אבל זו בעית ארכיקטורה וסביר להניח שברגע שנגיע ל-ASI או RSI זה כבר יפתר ממילא עם גילוי שיטות חדשות ויעילות יותר לזיכרון לטווח בינוני וארוך.
לגבי בעיות המתמטיקה, אתה קצת מפשט (בלשון המעטה) את מה שכלול בפתרון הנאוויה סטוקס או בעיות ארדוש. זה לא סתם "בוא נמצא את הפתרון", אלא תיאום מורכב ועצום בין אינסוף נקודות וחלקים.
זה בהחלט נכנס להגדרה של "צריך לתאם מאות החלטות, לעשות את החיבורים הנכונים בין חלקים שאין ביניהם קשר, ולזכור אלפי פרטים שאתה מחליט שהם חשובים: למה נעשתה בחירה מסוימת, מה כבר נשבר, מה עלול להישבר."
הוא אכן רחוק שנות אור מהמוח האנושי, אבל לא מהכיוון שאתה חושב...אגב ראייה כוללת, חפש דוגמאות של סרטונים מבוססי קוד שקלוד אופוס 5.5 יצר, זה הרבה מעבר לראייה כוללת, זו ראייה על אנושית
אישית, אני אפילו לא בטוח שנראה AGI
לפי כל מדד של 2020, אנחנו עם AGI כבר שנים. השער פשוט זז כל הזמן, כך שהמושג שלעצמו חסר משמעות במידת מה.
אני משוכנע שאם תרצה ב-2050 להכחיש קיום של AGI, תמצא מגוון דרכים לשכנע את עצמך.
ושוב: ברגע ש-AI ישתפר באופן רקורסיבי, לכל הבעיות ימצא פתרון במהירות גבוהה בהרבה משניתן לדמיין.
אני עם @א.מ.ד. - ניפגש בתשרי תשפ"ח

ניפגש בתשרי תשפ"ח
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב? או שזה ידע שלא קיים בכלל באינטרנט.
בכל אופן מה לגבי הטענה של לא נתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככהבעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
-
ניפגש בתשרי תשפ"ח
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב? או שזה ידע שלא קיים בכלל באינטרנט.
בכל אופן מה לגבי הטענה של לא נתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככהבעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
-
ניפגש בתשרי תשפ"ח
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב? או שזה ידע שלא קיים בכלל באינטרנט.
בכל אופן מה לגבי הטענה של לא נתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככהבעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
-
ניפגש בתשרי תשפ"ח
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב? או שזה ידע שלא קיים בכלל באינטרנט.
בכל אופן מה לגבי הטענה של לא נתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככהבעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב?
הימור שלי 2030-2035. בפועל ציר הזמן כנראה יהיה מהיר יותר.
או שזה ידע שלא קיים בכלל באינטרנט.
בוודאי שקיים. על לינוקס שמעת?

בכל אופן מה לגבי הטענה של לא מתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככההחלק הראשון לא נכון. החלק השני יהיה גם יהיה. בוודאות. פשוט אין סיבה מספיק טובה להניח שיהיה מחסום שיעצור את ההתקדמות הזו, בארכיקטורה זו או אחרת.
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככה
(לא צריך למחוק הקשר של מתכנתים פחות טובים, זה חסר משמעות בסדר גודל של המודלים היום.)
בעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
חפש הדגמות של דברים שקלוד אופוס 5.5 יצר. הדוגמה שהבאת היא אפילו לא בדיחה לעומת היכולות שלו.
זה בשבילך - https://miaai-lab.github.io/Claude-Opus-5.5-100-HTML-Files/014-kinetic-manifesto.html
וזו הדוגמה הכי פשוטה ובסיסית שיש, מצורף גם להורדה
-
פוסט זה נמחק!
-
פוסט זה נמחק!
-
מתי אתה מהמר יהיה אפשר לכתוב לAI תעשה לי מערכת הפעלה למחשב?
הימור שלי 2030-2035. בפועל ציר הזמן כנראה יהיה מהיר יותר.
או שזה ידע שלא קיים בכלל באינטרנט.
בוודאי שקיים. על לינוקס שמעת?

בכל אופן מה לגבי הטענה של לא מתייאש שהקוד של AI לא מתקרב לרמה של מתכנת אנושי ושהוא נוטה להביא קוד שגורם לבעיות בהמשך, ושאין לו תפיסה של כל הפרוייקט במיוחד כשמדובר על הרבה קבצים.
מדובר בעצם בטענה טכנית מציאותית שאי אפשר להתווכח
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככההחלק הראשון לא נכון. החלק השני יהיה גם יהיה. בוודאות. פשוט אין סיבה מספיק טובה להניח שיהיה מחסום שיעצור את ההתקדמות הזו, בארכיקטורה זו או אחרת.
אתה יכול לטעון שזה ישתנה בהמשך אם יצליחו לעשות הקשר יותר גדול ואימון יותר גדול שימחק ממנו הרבה אימון על קוד של מתכנתים פחות טובים וכדומה, אבל כרגע המצב שזה לא ככה
(לא צריך למחוק הקשר של מתכנתים פחות טובים, זה חסר משמעות בסדר גודל של המודלים היום.)
בעבר נתתי לך אתגר לתת לAI לעשות אתר דף נחיתה כמו https://mirindastudio.com/ וראית שהוא די מתקשה
חפש הדגמות של דברים שקלוד אופוס 5.5 יצר. הדוגמה שהבאת היא אפילו לא בדיחה לעומת היכולות שלו.
זה בשבילך - https://miaai-lab.github.io/Claude-Opus-5.5-100-HTML-Files/014-kinetic-manifesto.html
וזו הדוגמה הכי פשוטה ובסיסית שיש, מצורף גם להורדה
חפש הדגמות של דברים שקלוד אופוס 5.5 יצר. הדוגמה שהבאת היא אפילו לא בדיחה לעומת היכולות שלו.
זה בשבילך - https://miaai-lab.github.io/Claude-Opus-5.5-100-HTML-Files/014-kinetic
ווואו מטורף
איך הוא עשה את זה לבד???
ק
בקיצור - קישור לא תקין.. -
חפש הדגמות של דברים שקלוד אופוס 5.5 יצר. הדוגמה שהבאת היא אפילו לא בדיחה לעומת היכולות שלו.
זה בשבילך - https://miaai-lab.github.io/Claude-Opus-5.5-100-HTML-Files/014-kinetic
ווואו מטורף
איך הוא עשה את זה לבד???
ק
בקיצור - קישור לא תקין.. -
@NH.LOCAL השאלה מי יצר את הפרומט שיצר את זה...
גם במודלים הישנים אם היית מפרט לגמרי מה לעשות ואיך לעשות הוא היה יכול לעשות הכל, השאלה מה הוא יכול לעשות בפרומט של "בנה אתר מקצועי ומסודר וכ"ו וכ"ו בלי להכנס לדקויות של עם איזה סיפריות לבנות או איזה אנימציות וסגנון עיצוב.ההתקדמות של ה AI תלויה לדעתי לחשוב לבד, אפשר לבנות כל תוכנה עם AI אם מסבירים לה איזה קוד לכתוב בדיוק ואיפה לשים כל קטע קוד אבל ככה הAI לא עוזר בכלום.
אתר באמת מטורף, כ"כ הרבה אלמנטים חכמים שמתחברים.
הכי אהבתי את הקטע האחרון של ה MOVE שנכנסים לתוך האות O, זה פשוט מטורף, אבל שוב, זה כבר יותר מדי.
-
-
@NH.LOCAL , @לא-מתייאש כן צודק בזה שבעיקרון למידת החיזוק מבוססת על דברים הניתנים לאימות בצורה אמינה וזולה, ע"י שסביבת ה-RL נותנת משוב למודל לפי תוצאות הריצה. כמובן שזה משפיע על כלל יכולות המודל, אבל לכן ההתקדמות ניכרת יותר בתחומים האלו, כמו מתמטיקה, קוד, היגיון, משימות סוכן, שחמט וכדומה, ופחות בתחומים פתוחים יותר, כמו הבנת העולם האמיתי (כל עוד אין למודלים גוף פיזי-רובוטי שמאפשר להם לאמת משימות חיות), מדע, ידע, כתיבה יצירתית (למרות שדווקא בזה כבר מזמן המודלים עקפו את בני האדם) ותחומים נוספים, שבהם נדרש שיפוט ואימות אנושי איטי ויקר ופחות אמין בדרך כלל.
אבל פה בדיוק נמצא אחד מצירי המחקר החשובים ביותר בתחום ה-AI: חברות ה-AI מוצאות דרכים לאמת גם תחומים נוספים באמצעים שונים, גם אם האימות חלש יותר, מה שמאפשר ל-RL להשפיע גם עליהם, כך שהפער הזה הולך וקטן. לדוגמה בתחום הבנת העולם האמיתי, הקפיצה הקודמת הייתה לדעתי עם Gemini 3 Pro, והקפיצה הנוכחית באה עם GPT 6 Astra.
אפשר לראות את ההבדל הזה עם המודל הפתוח VibeThinker 3B, שעבר תהליך RL מסיבי במשימות הניתנות לאימות (בעיקר משימות היגיון ותכנות תחרותי בסגנון LeetCode) ושיפור תהליך "חיפוש" מסלולי החשיבה הנכונים, ובאלו הוא מתקרב בביצועים למודלים גדולים ועצומים, אבל בידע ותחומים אחרים הוא נשאר נאמן לגודלו - 3B...
אפשר לראות פה:

שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות