שיתוף | מה חדש בבינה מלאכותית - מתעדכן
-
לקרוא את הפרשנויות על אופוס 5.5 ולהתפלץ... אוחח... גאונות
רק הישראלים כאן (שבכלל לא למדו תכנות...) יכולים לקבוע בהחלטיות ש-GPT יותר טוב מ-Claude, ולחלוק על כל העולם כולל GPT עצמם...
בסקירות שGPT פרסמה לAstra, היא עצמה קבעה שהוא שווה או קצת פחות מפייבל 5.1 ואופוס 5 (לא 5.5) ברוב המשימות (מלבד מדד אחד ספציפי).
עכשיו נוסיף למשוואה שלמפתחים עצמם יש נטייה מוזרה להגזים כלפי מעלה... ולכן נוריד כמה נקודות, מה יצא לנו? בנצ'מארק מבית GPT שפייבל ואופוס טובים מהם.. נהדר -
גוגל משיקה: Gemini 3.8 TTS – יצירת קולות, בימוי שיחה ושכפול קול ב-AI
גוגל הכריזה רשמית על שני מודלי Text-to-Speech חדשים ממשפחת ג'מיני, שמשדרגים משמעותית את תחום יצירת הדיבור (TTS) והופכים אותו מ"קריינות סטטית" למעין סטודיו דיבוב מלא:
- Gemini 3.8 Flash TTS: מודל הדגל לתחום היצירתי. מיועד לבימוי דיאלוגים מורכבים, פודקאסטים, ספרי שמע ומשחקים.
- Gemini 3.8 Flash-Lite TTS: גרסה קלה, חסכונית ומהירה במיוחד, המיועדת להפקה בכמויות גדולות (דיבוב, סוכני שיחה בזמן אמת וכד').
החידושים והיכולות המרכזיות:
- עיצוב קול באמצעות פרומפט (Generative Voice Design): ניתן להגדיר בטקסט חופשי אופי קול, מבטא, גיל ותכונות אופי (למשל: "קריין סמכותי", "מנחה אנרגטי") ביותר מ-100 שפות וניבים.
- שכפול קול (Voice Cloning): יצירת פרופיל קול מותאם אישית מדגימת אודיו של 30 שניות בלבד (כולל מנגנון אימות הסכמה מובנה וחתימת מים דיגיטלית של SynthID).
- בימוי טקסט שורה-אחר-שורה (Direct line-by-line): שליטה מלאה על רגש, הדגשות, לחישות והפסקות.
- סצנה דו-דוברת (Dual-Speaker Scene): הפקת דיאלוג רציף בין שני קולות שונים מאותו תסריט, כולל כניסה טבעית זה לדברי זה.
- שילוב קולות אנושיים וקולות רקע: תמיכה בתגובות טבעיות בתוך הטקסט, כגון צחוק (
<laughs>), אנחה (<sigh>), התנשפות (<gasp>), או הנהונים (|mhm|,|yeah|). - שמירה על עקביות לאורך זמן: שיפור ניכר בתוכן ארוך ללא עיוותי קול או "בריחה" מגוון הקול המקורי.
- ביצועים במבחנים: המודל הגיע למקום הראשון במדד Hume AI Voice Design ובטבלת ה-Voice Arena.
זמינות והתנסות:
- למפתחים: זמין כבר עכשיו ב-Google AI Studio (כולל ממשק ייעודי לעיצוב קול ותסריטי שיחה) וב-API של ג'מיני.
- למשתמשים: משולב כבר ב-Gemini Notebook וב-Google Vids.
לפוסט הרשמי בבלוג של גוגל:
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
שלום! נראה שהשיחה הזו מעניינת אותך, אבל עדיין אין לך חשבון.
נמאס לכם לגלול בין אותם הפוסטים בכל ביקור? כשנרשמים לחשבון, תמיד תחזרו בדיוק למקום שבו הייתם קודם, ותוכלו לבחור לקבל התראות על תגובות חדשות (בין אם במייל, ובין אם בהתראת פוש). תוכלו גם לשמור סימניות ולפרגן ב-upvote לפוסטים כדי להביע הערכה לחברי קהילה אחרים.
בעזרת התרומה שלך, הפוסט הזה יכול להיות אפילו טוב יותר 💗
הרשמה התחברות
