Suno מתרחבת מעבר למוזיקה: פיצ'ר חדש מייצר קול דיבור יחד עם מוזיקת רקע
Suno, שעד היום עסקה ביצירת מוזיקה באמצעות AI, משיקה את Speech: פיצ'ר בגרסת בטא ציבורית שמייצר קול דיבור מתוך תסריט או תיאור, ויכול להוסיף לו מוזיקת רקע בעת ובעונה אחת. לפי החברה, זה המודל הראשון שמייצר קול ומוזיקה יחד ברצועה אחת.
חברת Suno, שהתפרסמה בזכות כלי ליצירת שירים באמצעות בינה מלאכותית, מתרחבת לתחום הדיבור. לפי The Verge, החברה השיקה פיצ'ר חדש בשם Speech. הוא מייצר קולות דיבור סינתטיים לפי תסריט או לפי תיאור חופשי, ויכול להפיק במקביל מוזיקת רקע שמלווה אותם. הפיצ'ר זמין כבר עכשיו בגרסת בטא ציבורית, באתר של Suno ובאפליקציות שלה.
"הקול והמוזיקה כרצועה אחת"
"המוזיקה תמיד תהיה בלב של Suno ושל מה שאנחנו בונים. עם זאת, החזון שלנו תמיד כלל גם צורות אחרות של ביטוי אנושי", אמר ג'ק ברודי, מנהל המוצר הראשי של Suno, בהודעה על ההשקה. לדבריו, Speech הוא "מודל האודיו הראשון שמייצר קול ומוזיקה יחד, כרצועה אחת שלמה". זו טענה של החברה עצמה, ולא ברור עדיין איך היא תעמוד מול המתחרים.
השילוב עם מוזיקה הוא מה שמבדיל את Speech מכלי text-to-speech (המרת טקסט לדיבור) רגילים. מי שרוצה רק דיבור נקי יכול לכבות את מוזיקת הרקע במתג. אבל הרעיון הוא להתאים פסקול לסוג הטקסט: מוזיקה רגועה לקריאת שירה, או משהו אנרגטי יותר לקריינות דרמטית ולנאומים שנועדו לעורר השראה.
איך זה עובד
הפיצ'ר נמצא בלשונית "Create", תחת האפשרות Speech, ויש בו שני מצבים:
- Simple: מתארים בתיבת טקסט מה רוצים לקבל, למשל "קפטן פיראטים שמלהיב את הצוות שלו".
- Advanced: מזינים תסריט מוכן, כשכבר יודעים בדיוק מה הקול צריך להגיד. במצב הזה אפשר גם לבחור את מגדר הקול, את סגנון הדיבור ואת מידת השונות בין הפקה להפקה.
אורך ההקלטה המרבי הוא כשמונה דקות.
"בטא זה באמת בטא"
ב-Suno לא מעמידים פנים שהמוצר גמור. "בטא זה באמת בטא", אמר ברודי. "מדי פעם מבטא בריטי עלול לנדוד לאוסטרליה ולחזור. הפסקות דרמטיות עשויות להיות דרמטיות מאוד. כמעט בוודאות תגלו לזה שימושים שלא עלו בדעתנו". החברה אומרת שתמשיך לשפר את Speech לפי המשוב של המשתמשים.
שוק צפוף, ומניע אפשרי
דיבור סינתטי אינו תחום חדש. כפי ש-The Verge מציין, DeepMind מתנסה כבר עשור בסינתזת דיבור באמצעות deep learning, ל-Adobe יש כלי text-to-speech משלה, ו-ElevenLabs הפכה מאז השקתה ב-2023 לאחת הפלטפורמות המוכרות בתחום. Suno נכנסת לשוק שיש בו כבר שחקנים מבוססים.
לפי ההערכה של The Verge, המהלך נועד ככל הנראה לגוון את הפעילות של Suno, משום שמחולל המוזיקה שלה ספג תביעות רבות. החברה עצמה מציגה את ההרחבה כחלק מחזון רחב יותר לכלי ביטוי אנושי.
למה זה חשוב
המשמעות היא ש-Suno מנסה להפוך מכלי ליצירת שירים לסטודיו אודיו כללי יותר. יוצרי פודקאסטים, תוכן לרשתות ולמידה דיגיטלית יכולים, לפחות בתיאוריה, לקבל קריינות ופסקול בפעולה אחת ולא בשני כלים נפרדים. אם השילוב הזה יעבוד בפועל, ייתכן שזה יהיה היתרון של Suno מול חברות שמתמחות רק בקול. בינתיים, כפי שהחברה עצמה מודה, מדובר במוצר בשלבים מוקדמים, והאיכות שלו עוד תיבחן אצל המשתמשים.