דילוג לתוכן
  • חוקי הפורום
  • פופולרי
  • לא נפתר
  • משתמשים
  • חיפוש גוגל בפורום
  • צור קשר
עיצובים
  • בהיר
  • Brite
  • Cerulean
  • Cosmo
  • Flatly
  • Journal
  • Litera
  • Lumen
  • Lux
  • Materia
  • Minty
  • Morph
  • Pulse
  • Sandstone
  • Simplex
  • Sketchy
  • Spacelab
  • United
  • Yeti
  • Zephyr
  • כהה
  • Cyborg
  • Darkly
  • Quartz
  • Slate
  • Solar
  • Superhero
  • Vapor

  • ברירת מחדל (ללא עיצוב (ברירת מחדל))
  • ללא עיצוב (ברירת מחדל)
כיווץ
מתמחים טופ
  1. דף הבית
  2. קטגוריות בהרצה
  3. תכנות
  4. בינה מלאכותית - AI
  5. עזרה הדדית - בינה מלאכותית
  6. שיתוף | מה חדש בבינה מלאכותית - מתעדכן

שיתוף | מה חדש בבינה מלאכותית - מתעדכן

מתוזמן נעוץ נעול הועבר עזרה הדדית - בינה מלאכותית
463 פוסטים 88 כותבים 39.9k צפיות 135 עוקבים
  • מהישן לחדש
  • מהחדש לישן
  • הכי הרבה הצבעות
תגובה
  • תגובה כנושא
התחברו כדי לפרסם תגובה
נושא זה נמחק. רק משתמשים עם הרשאות מתאימות יוכלו לצפות בו.
  • המלאךה מנותק
    המלאךה מנותק
    המלאך
    כתב נערך לאחרונה על ידי
    #461

    קלוד הצליח לפרוץ בעקבות הגדרה שגוייה את הסאנדבוקס של האימון ולפרוץ בפועל לשלוש ארגונים.

    https://www.geektime.co.il/anthropic-claude-cybersecurity-evals-incident/

    האתר שלי: https://amlaach.github.io/personal-site/

    שמואל5ש תגובה 1 תגובה אחרונה
    😲 🤔 🤖 🙄
    6
    • המלאךה המלאך

      קלוד הצליח לפרוץ בעקבות הגדרה שגוייה את הסאנדבוקס של האימון ולפרוץ בפועל לשלוש ארגונים.

      https://www.geektime.co.il/anthropic-claude-cybersecurity-evals-incident/

      שמואל5ש מנותק
      שמואל5ש מנותק
      שמואל5
      כתב נערך לאחרונה על ידי
      #462

      @המלאך הכתבה לחסומים:

      חברת אנת'רופיק פרסמה הלילה (ו') פוסט יוצא דופן בבלוג שלה, שחושף כי שלושה ממודלי קלוד שלה הצליחו לצאת מחוץ לסביבת ניסוי סגורה, ותקפו מערכות אמיתיות של שלושה ארגונים שונים במהלך 6 הרצות נפרדות. החשיפה מגיעה בעקבות תחקיר מקיף שערכה החברה על יותר מ-140 אלף ניסויים שערכה, שהגיע אחרי תקרית האבטחה הדומה של OpenAI – אם כי באנת'רופיק מדגישים כי בניגוד ל-OpenAI שם המודלים ניצלו חולשת Zero-Day כדי "לברוח" מסביבת הניסוי, כאן מדובר בכשל תפעולי בהגדרות, שהשאיר גישה פתוחה לרשת.

      המודלים תקפו חברות אמיתיות
      על פי אנת'רופיק, התקלה התרחשה במהלך תרגיל CTF או "תפוס את הדגל" – פרקטיקה מוכרת בתחום הסייבר, שמאתגרת משתתפים למצוא מחרוזת טקסט סודית שהוחבאה. אנת'רופיק בדקה את המודלים ויכולות הסייבר שלהם מול ממשקי API ומערכות מורכבות, כשהם הונחו במפורש לפעול כאילו אין להם חיבור לרשת. המבחנים בוצעו על גרסאות "גולמיות" של המודלים, ללא שכבות הבטיחות והמסננים הרגילים שיהיו זמינים כמובן כשיושקו, כדי למתוח את הגבולות שלהם במקרי קיצון.

      בפועל, הגדרה שגויה בתשתית של הבדיקות השאירה למודלים גישה פתוחה לאינטרנט. מכיוון שהמודלים הניחו שכל מה שנמצא מולם הוא חלק מסימולציית הבדיקה, הם החלו לתקוף שרתים שגילו, בלי לדעת שמדובר בשרתים של חברות אמיתיות.

      במקרה החמור ביותר כנראה, נתקל מודל Claude Opus 4.7 בחברה אמיתית בעלת שם זהה לשם היעד המומצא בניסוי. המודל ניצל חולשות אבטחה בסיסיות, כמו סיסמאות חלשות ו-Endpoints ללא אימות, שלף הרשאות וקיבל גישה לדאטהבייס של החברה, שהכיל מאות רשומות מתוך סביבת הפרודקשן שלה. למרות שבשלב מסוים המודל זיהה כי מדובר במערכת אמיתית, הוא המשיך במתקפה מכיוון ש"הניח" שמדובר בחלק מובנה ומתוחכם מהאתגר ולא באג.

      באירוע שני, מודל Claude Mythos 5 נתקל בהוראות פיקטיביות שהורו לו להתקין חבילת קוד שלא הייתה קיימת בספריית PyPI. המודל החליט ליזום מתקפת שרשרת אספקה מסוג Dependency Confusion, שלא היה מבייש קבוצת תקיפה צפון קוריאנית: בשלב הראשון הוא החליט ליצור בעצמו את החבילה החסרה, ולהעלות אותה למאגר הציבורי עם קוד זדוני ששתל בה, ואז הגיע הקטע המרשים.

      כל מי שפתח חשבון ב-PyPI יודע שהוא צריך כתובת מייל, וכדי להשיג מייל נדרש אימות במספר טלפון שלא היה לו. המודל לא ויתר, וניסה למצוא דרכים להשיג תקציב כדי לשלם על שירות מספרי טלפון וירטואליים. כשנכשל בזה, הוא עשה "חישוב מסלול מחדש", מצא שירות מייל חינמי שלא דורש אימות טלפוני, נרשם איתו ל-PyPI והעלה את הנוזקה לרשת הפתוחה – כך שהיא הייתה זמינה לכל המשתמשים.

      הנוזקה הייתה באוויר רק שעה, אבל כבר הורדה על ידי 15 מערכות אמיתיות. בין המערכות שהורידה והתקינה את החבילה הנגועה שיצר מיתוס הייתה גם, למרבה האירוניה, חברת אבטחה, שרצתה לסרוק את הקוד, אבל הקוד הזדוני של קלוד הופעל, גנב את פרטי ההזדהות של החברה ושלח אותם לשרת שהמודל הקים מראש – מה שאפשר לו לחדור לתשתיות נוספות של אותה חברה. מתיעוד ה-Reasoning של המודל, כלומר הלוג של כל ההחלטות שהוא קיבל בדרך, עולה שלמרות שהמודל חשד תחילה שמדובר במתקפה אמיתית, הוא שכנע את עצמו שהוא בסימולציה משום שלא זיהה את תעודות האבטחה, ה-CAs האמיתיות שאבטחו את התעבורה, ומכיוון שתאריך המערכת הצביע על שנת 2026.

      המקרה השלישי והקל יותר הגיע ממודל מחקר פנימי, שסרק כ-9,000 יעדים ברשת ופרץ לאפליקציה שמצא באמצעות פרצת אבטחה בעמוד חשוף וקצת SQL Injection טוב. עם זאת, החדשות הטובות הן שברגע שהמודל זיהה שהשרת שייך לחשבון ענן אמיתי שאינו קשור לתרגיל, הוא עצר את המתקפה ביוזמתו.

      הקשר הישראלי
      חוקרי אנת'רופיק ערכו את הבדיקות בשיתוף חברת הסטארטאפ הישראלית Irregular, עליה כתבנו בעבר כאן. בחברה הסבירו כי הפעולות נבעו מתפיסה שגויה של הסיטואציה, כשהמודלים הונחו שאין להם גישה לאינטרנט וקיבלו משימה "להשיג את הדגל", בעוד שבפועל הוגדר בטעות חיבור לרשת. עם הגילוי עצרה אנת'רופיק את מבחני האבטחה, דיווחה לארגונים שנפגעו, והודיעה שהיא פועלת להקשיח את סביבות הניסוי. בחברה גם הדגישו שגרסאות המודלים הציבוריות כוללות שכבות הגנה הדוקות שהיו חוסמות את הפעולות האלו.

      תגובה 1 תגובה אחרונה
      6
      • לשכת הרבל מנותק
        לשכת הרבל מנותק
        לשכת הרב
        כתב נערך לאחרונה על ידי
        #463

        שדרוג תצוגת ממשק גימיני

        a9a5eb3d-f94e-472d-b4b0-8c3993fecff2-image.jpeg

        תגובה 1 תגובה אחרונה
        2

        שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.

        נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.

        בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗

        הרשמה התחברות

        • התחברות

        • אין לך חשבון עדיין? הרשמה

        • התחברו או הירשמו כדי לחפש.
        • פוסט ראשון
          פוסט אחרון
        0
        • חוקי הפורום
        • פופולרי
        • לא נפתר
        • משתמשים
        • חיפוש גוגל בפורום
        • צור קשר