ג'ינגל, פודקאסט וקריינות עם AI: אולפן הקלטות שלם בלי אולפן
איך להפיק ג'ינגל לעסק, פרק פודקאסט שלם או קריינות מקצועית בעברית בעזרת AI, בלי ציוד, בלי ניסיון ובלי להוציא אלפי שקלים על אולפן.
עד לפני שנתיים, אם רציתם ג’ינגל לעסק הייתם צריכים מלחין, זמר, אולפן ותקציב של כמה אלפי שקלים. פודקאסט דרש מיקרופון טוב, חדר שקט, עורך סאונד ושעות של עבודה על כל פרק. קריינות מקצועית לסרטון תדמית? קריין, אולפן, ותיקונים בתשלום על כל משפט ששיניתם.
היום אפשר לעשות את שלושת הדברים האלה מהמחשב בבית, בערב אחד, בעברית. לא “בערך”, אלא ברמה שאפשר לפרסם.
המדריך הזה מיועד לבעלי עסקים קטנים שרוצים ג’ינגל לרילס או לפרסומת ברדיו, ליוצרי תוכן שרוצים להתחיל פודקאסט בלי להתעכב על טכניקה, למי שצריך קריינות לסרטוני הדרכה, למורים ומרצים שרוצים להפוך חומר כתוב לאודיו, ולכל מי שסקרן. לא צריך אוזן מוזיקלית, לא צריך קול של קריין, ולא צריך להבין באודיו. צריך לדעת לכתוב פרומפט טוב, וזה בדיוק מה שנלמד כאן.
נעבור על שלושת התרחישים אחד אחד, עם פרומפטים מוכנים להעתקה, ואז על העריכה, על הזכויות, ועל הטעויות שכמעט כולם עושים בפעם הראשונה.
מה באמת אפשר להפיק היום, ומה עדיין לא
לפני שנצלול, חשוב ליישר ציפיות. יש שלושה סוגי כלים שעובדים יחד, וכל אחד עושה משהו אחר:
מודלי שפה (ChatGPT, Claude, Gemini) לא מפיקים סאונד. הם כותבים: מילים לשיר, תסריט לפודקאסט, טקסט לקריינות, תיאור סגנון מוזיקלי. זה השלב הכי חשוב בתהליך, כי איכות התוצר הסופי נקבעת בטקסט הרבה לפני שנשמע צליל.
מחוללי מוזיקה (Suno, Udio) מקבלים מילים ותיאור סגנון ומחזירים שיר שלם עם שירה, כלי נגינה ומיקס. הם תומכים בעברית, אבל עם הסתייגויות שנדבר עליהן.
מחוללי קול (ElevenLabs, ובמידה פחותה כלי ה-Text-to-Speech של גוגל ומיקרוסופט) הופכים טקסט לדיבור. ElevenLabs הוא הכלי המוביל כרגע לעברית טבעית, כולל אפשרות לשכפל את הקול שלכם. ל-Gemini יש גם את NotebookLM, שיודע להפוך מסמכים לשיחת פודקאסט בין שני מגישים, כולל בעברית.
מה עדיין לא עובד טוב? הגייה של שמות פרטיים וראשי תיבות בעברית, מוזיקה שצריכה להישמע בדיוק כמו שיר קיים (וגם אסור), ושירה בעברית עם מבטא ישראלי מושלם. בכל אלה תצטרכו להשקיע כמה סבבים של תיקונים. זה חלק מהתהליך, לא כישלון שלו.
ג’ינגל לעסק בארבעה צעדים
ג’ינגל טוב הוא לא שיר. הוא 15 עד 30 שניות עם משפט אחד שנתקע בראש. רוב האנשים מתחילים מהמוזיקה, וזו טעות. מתחילים מהמסר.
צעד 1: להוציא מהעסק שלכם את המשפט האחד. פתחו את ChatGPT, Claude או Gemini ותנו להם את ההקשר האמיתי:
אני בעל מאפייה שכונתית ברמת גן בשם "לחם של שבת". אנחנו אופים
בלילה ופותחים ב-6 בבוקר, והקהל שלנו הוא משפחות מהשכונה.
אני רוצה ג'ינגל של 20 שניות לרילס ולפרסומת ברדיו מקומי.
תן לי 8 רעיונות לשורת מחץ (hook) של עד 7 מילים, בעברית מדוברת
וטבעית, בלי סלנג מאולץ ובלי חרוזים דביקים. לכל רעיון תסביר
במשפט מה הרגש שהוא מעורר.
בחרו את השורה שאתם עצמכם הייתם מזמזמים. אם אף אחת לא כזו, בקשו סבב נוסף עם כיוון אחר (“יותר חם”, “יותר קצבי”, “פחות שיווקי”).
צעד 2: לכתוב את המילים. ג’ינגל של 20 שניות זה בערך 4 עד 6 שורות. בקשו מהמודל מבנה ברור:
השורה שבחרתי: "לחם של שבת, כל בוקר".
כתוב מילים לג'ינגל של 20 שניות במבנה: 2 שורות פתיחה, שורת
המחץ, 2 שורות, ושוב שורת המחץ בסוף. הברות קצרות, קל לשיר,
בלי מילים שקשה להגות. הוסף ניקוד מלא לכל המילים.
הניקוד הוא לא קישוט. מחוללי מוזיקה מתקשים לנחש איך להגות מילה עברית בלי ניקוד, וטקסט מנוקד משפר את ההגייה באופן משמעותי. עוד טריק שעובד: אם מילה מסוימת יוצאת משובשת, כתבו אותה בתעתיק לטיני (למשל “shabat” במקום “שבת”) רק במקום הבעייתי.
צעד 3: לתאר את הסגנון בשפה שהמחולל מבין. Suno ו-Udio מקבלים “style prompt” באנגלית שמתאר ז’אנר, טמפו, כלים ואווירה. אל תכתבו “משהו שמח”. בקשו מהמודל לתרגם את הכוונה שלכם למונחים מקצועיים:
תאר עבור Suno את סגנון הג'ינגל באנגלית, ב-2 שורות: ז'אנר,
טמפו ב-BPM, כלי נגינה, סוג הקול (זמר/זמרת, גיל משוער, אופי),
ואווירה. הרגש: בוקר של שבת, חם, ביתי, קצת נוסטלגי,
מתאים למשפחות. לא אלקטרוני ולא "פרסומת".
תקבלו משהו כמו: “Warm acoustic folk-pop jingle, 100 BPM, acoustic guitar, upright bass, light hand claps, female vocal, friendly and homey, short catchy hook.” זה בדיוק מה שמדביקים בשדה הסגנון.
צעד 4: להפיק, לבחור, לתקן. ב-Suno תדביקו את המילים המנוקדות בשדה הליריקה ואת התיאור בשדה הסגנון, ותקבלו שני ביצועים שונים לכל הרצה. הפיקו לפחות 4 עד 6 גרסאות לפני שאתם מחליטים. אל תתאהבו בגרסה הראשונה. אם הזמר שר מילה לא נכון, תקנו את הניקוד או את התעתיק של המילה הזו בלבד והריצו שוב. אם הקצב לא מתאים, שנו רק את ה-BPM. שינוי אחד בכל פעם, אחרת לא תדעו מה עזר.
טיפ שלא כתוב בשום מקום: בקשו גרסה אינסטרומנטלית של אותו ג’ינגל (יש כפתור ייעודי). תקבלו רקע מוזיקלי נקי שאפשר לשים מתחת לקריינות, לסטורי או לתפריט הטלפוני של העסק, ואז המותג שלכם נשמע אותו דבר בכל מקום.
פרק פודקאסט מאפס: מהרעיון לקובץ מוכן
יש שתי דרכים להפיק פודקאסט עם AI. הראשונה: אתם מדברים, ה-AI עוזר בכל השאר. השנייה: ה-AI מדבר במקומכם. נתחיל מהראשונה, כי היא מייצרת פודקאסט שאנשים באמת רוצים לשמוע.
שלב התכנון. רוב הפודקאסטים נכשלים לא בגלל הסאונד אלא בגלל שהפרק לא הולך לשום מקום. תנו למודל את הנושא ובקשו מבנה שאפשר להקליט לפיו:
אני מקליט פודקאסט לבעלי עסקים קטנים בישראל. הפרק הקרוב על
"איך לגבות מלקוחות שלא משלמים בזמן". אורך יעד: 20 דקות, מגיש
אחד בלי אורח.
בנה לי מתווה פרק: פתיחה של 30 שניות עם סיפור או שאלה שתופסת,
3 עד 4 חלקים עם כותרת ו-3 נקודות מפתח לכל אחד, ומעבר טבעי בין
החלקים. סיים בפעולה אחת שהמאזין יכול לעשות היום. אל תכתוב לי
תסריט מלא, רק נקודות, כדי שאדבר חופשי.
שימו לב לבקשה האחרונה. תסריט מלא שקוראים מילה במילה נשמע כמו קריאה, ואנשים שומעים את זה תוך שניות. מתווה עם נקודות מכריח אתכם לדבר, וזה נשמע כמו פודקאסט.
שלב ההקלטה. אין צורך באולפן. שלושה כללים מספיקים: חדר קטן עם בדים (חדר שינה עדיף על סלון), טלפון או מיקרופון במרחק אגרוף מהפה, ולהקליט 10 שניות של שקט בהתחלה. השקט הזה ישמש אחר כך את כלי ניקוי הרעש. אפליקציית ההקלטה הרגילה של הטלפון מספיקה להתחלה.
שלב העריכה בטקסט. כאן ה-AI חוסך את רוב הזמן. כלים כמו Descript מתמללים את ההקלטה ומאפשרים לערוך את האודיו על ידי מחיקת מילים בטקסט. מחקתם “אממ”, האודיו התקצר. סימנתם פסקה שחזרתם עליה פעמיים, היא נעלמת. יש להם גם פונקציית “Studio Sound” שמנקה הד ורעש רקע בלחיצה. התמלול בעברית לא מושלם, אבל לצורך עריכה הוא מספיק טוב.
שלב החומר הנלווה. אחרי שיש לכם תמלול, תנו אותו למודל שפה:
הנה תמלול של פרק פודקאסט. כתוב לי:
1. תיאור פרק של עד 60 מילים לספוטיפיי ואפל, שמתחיל מהבעיה
ולא מ"בפרק הזה נדבר על".
2. 5 כותרות אפשריות לפרק, קצרות, בלי קליקבייט.
3. חלוקה לפרקים עם חותמות זמן (אני אתאים אותן ידנית).
4. 3 ציטוטים מהפרק שמתאימים לפוסט ברשתות.
[הדבק תמלול]
והדרך השנייה: פודקאסט שכולו AI. NotebookLM של גוגל מקבל מסמכים (מאמר, מדריך, סיכום שכתבתם) ומפיק “Audio Overview”: שיחה בין שני מגישים וירטואליים שדנים בחומר, כולל בעברית. זה מצוין לשימוש פנימי: להפוך מסמך נהלים לשיחה שהעובדים ישמעו בדרך לעבודה, או לסכם חומר לימוד. לפודקאסט ציבורי זה פחות מתאים, כי המאזינים מזהים מהר שאין שם בן אדם, וגם כי אין לכם שליטה מלאה על מה שנאמר. אם אתם משתמשים בזה, תגידו למאזינים שזה AI. זה גם הגון וגם מונע מבוכה.
קריינות מקצועית בעברית: לגרום ל-AI לדבר כמו קריין
קריינות היא השימוש הכי מיידי ורווחי מבין השלושה. סרטון תדמית, מדריך וידאו, ספר שמע, הודעה במענה הקולי, סרטון הדרכה לעובדים. בכולם צריך קול ברור בעברית, ובכולם אפשר היום להסתדר בלי קריין.
בחירת הכלי והקול. ElevenLabs הוא הסטנדרט כרגע. במודל הרב-לשוני שלו העברית נשמעת טבעית, עם אינטונציה נכונה ברוב המשפטים. בספריית הקולות חפשו קולות שמסומנים כמתאימים לעברית, או העלו הקלטה של עצמכם ותקבלו שכפול של הקול שלכם (בתוכניות בתשלום). האפשרות השנייה מעולה לבעלי עסקים: הסרטונים נשמעים כמוכם, בלי שתצטרכו להקליט כל פעם מחדש.
הכנת הטקסט. קריינות לא כותבים כמו מאמר. משפטים קצרים, בלי פסוקיות מסובכות, בלי סוגריים. בקשו מהמודל להמיר את הטקסט הכתוב לטקסט מדובר:
זה טקסט לסרטון הדרכה על השימוש באפליקציה שלנו. הפוך אותו
לתסריט קריינות בעברית: משפטים של עד 12 מילים, שפה מדוברת אבל
לא סלנג, פנייה ישירה למשתמש בגוף שני. סמן הפסקות טבעיות בפסיקים
ונקודות. אל תוסיף מידע שלא היה בטקסט המקורי.
[הדבק טקסט]
הטריקים שעושים את ההבדל בעברית:
- ניקוד חלקי במילים דו-משמעיות. “ספר” יכול להיות סֵפֶר או סַפָּר. המחולל ינחש, ולפעמים ינחש לא נכון. נקדו רק את המילים האלה, לא את כל הטקסט.
- ראשי תיבות כותבים כמו שאומרים. במקום “מע”מ” כתבו “מעם”, במקום “ח”כ” כתבו “חבר כנסת”. במקום “AI” כתבו “איי איי”.
- מספרים במילים. “2,500 שקל” יקרא לפעמים לא נכון. “אלפיים חמש מאות שקל” תמיד יקרא נכון.
- שמות פרטיים ושמות מותג באנגלית לרוב יוצאים טוב יותר כשכותבים אותם באותיות לטיניות מאשר בתעתיק עברי.
- הפסקות. נקודה מייצרת עצירה קצרה, שורה ריקה מייצרת עצירה ארוכה יותר. אל תסתמכו על סימנים מיוחדים שאתם לא בטוחים שהכלי תומך בהם.
כוונון הגדרות. ב-ElevenLabs יש מחוון “Stability”. ערך גבוה נותן קול אחיד ומונוטוני, מתאים להודעות טלפוניות ולטקסט טכני. ערך נמוך נותן קול אקספרסיבי יותר, מתאים לסיפורים ולפרסומות, אבל לפעמים בורח לאינטונציות מוזרות. התחילו באמצע ורדו או עלו לפי הצורך. עוד הגדרה שכדאי להכיר היא “Speed”: העברית של רוב המחוללים יוצאת קצת מהר מדי לאוזן ישראלית, והאטה קלה משפרת את התחושה.
עבודה בקטעים. אל תזינו תסריט של 5 דקות בבת אחת. חלקו לפסקאות של 30 עד 60 שניות, הפיקו כל אחת בנפרד, ותקנו רק את מה שיצא לא טוב. זה גם זול יותר (רוב הכלים מחייבים לפי תווים) וגם מהיר יותר.
עריכה ופוסט-פרודקשן בלי אולפן ובלי ידע
יש לכם עכשיו קובץ מוזיקה, קובץ קריינות, ואולי הקלטה של עצמכם. איך מחברים את זה למשהו שנשמע מקצועי?
הכלי החינמי שמספיק לרוב האנשים הוא Audacity, תוכנה חינמית ותיקה. שלוש פעולות שכדאי ללמוד בה: הפחתת רעש (Noise Reduction, שמשתמשת ב-10 שניות השקט שהקלטתם), נרמול עוצמה (Normalize) כדי שכל הקטעים יהיו באותו ווליום, ו-Fade In/Fade Out לתחילת וסוף כל קטע. אם אתם לא יודעים איך, פשוט שאלו:
אני עורך פרק פודקאסט ב-Audacity ואין לי ניסיון. יש לי קובץ
הקלטה של הקול שלי וקובץ מוזיקת פתיחה. הסבר לי צעד אחר צעד,
עם שמות התפריטים המדויקים, איך: להוריד רעש רקע, לשים את
המוזיקה ב-10 השניות הראשונות ולהנמיך אותה בהדרגה כשאני מתחיל
לדבר, ולייצא ל-MP3 באיכות שמתאימה לספוטיפיי.
כלל הזהב של מיקס. כשיש מוזיקה מתחת לדיבור, המוזיקה צריכה להיות חלשה ממה שנראה לכם נכון. אם אתם שומעים את המוזיקה בבירור בזמן הדיבור, היא חזקה מדי. הנמיכו אותה עד שהיא “מורגשת” ולא “נשמעת”.
בדיקה בשלושה מכשירים. לפני שמפרסמים, תשמעו את התוצר באוזניות, ברמקול של הטלפון וברכב. מה שנשמע מצוין באוזניות יכול להישמע בוצי ברמקול קטן. אם הקריינות לא ברורה ברמקול של הטלפון, הגבירו מעט את התדרים הגבוהים או פשוט הנמיכו עוד את המוזיקה.
פורמט ייצוא. לפודקאסט: MP3 ב-128 kbps, מונו (לא סטריאו, זה חוסך מקום ואף אחד לא ישמע הבדל בקול מדובר). לג’ינגל ולמוזיקה: MP3 ב-320 kbps או WAV, סטריאו. לרשתות חברתיות: מה שהפלטפורמה מבקשת, לרוב MP4 עם תמונה סטטית או וידאו.
זכויות, שימוש מסחרי ומה צריך לדעת לפני שמפרסמים
זה הסקשן שכולם מדלגים עליו, ואז מופתעים.
מוזיקה. ב-Suno וב-Udio, זכויות השימוש המסחרי בשיר תלויות בסוג התוכנית. בתוכנית החינמית, השיר לרוב לא שלכם לשימוש מסחרי. ג’ינגל שמתנגן בפרסומת או בעסק זה שימוש מסחרי. לפני שמפיקים ג’ינגל לעסק, פתחו את תנאי השימוש העדכניים של הכלי (הם משתנים) ובדקו מה התוכנית שלכם מאפשרת. זה עולה כמה עשרות שקלים בחודש ומונע כאב ראש.
קולות. אל תשכפלו קול של אדם אחר בלי הסכמה כתובה. גם לא של ידוען, גם לא של קריין שאהבתם, וגם לא של עובד לשעבר. זה גם פוגע באנשים וגם לא חוקי ברוב המקרים. הקול שלכם, או קול מהספרייה שהכלי מספק, ואתם בסדר.
“בסגנון של”. לבקש ממחולל מוזיקה “שיר בסגנון של שלמה ארצי” לא יעבוד ברוב הכלים (הם חוסמים שמות אמנים), ובצדק. תארו את הסגנון במילים במקום: “בלדה ישראלית עם גיטרה אקוסטית, קול גברי חם, טמפו איטי”. תקבלו את מה שרציתם בלי לגעת בזכויות של אף אחד.
שקיפות. אם קריינות של AI מופיעה בפודקאסט או בסרטון שמתיימר להיות “אישי”, כדאי לציין את זה, גם בשורה קטנה בתיאור. הקהל הישראלי סלחן כלפי AI כשמספרים לו, ופחות סלחן כשהוא מגלה לבד.
טעויות נפוצות
להתחיל מהמוזיקה במקום מהמסר. ג’ינגל עם לחן מדהים ומשפט שאף אחד לא זוכר הוא בזבוז. תמיד קודם המילים.
להפיק גרסה אחת ולהחליט. מחוללי מוזיקה וקול הם הימור בכל הרצה. גרסה ראשונה היא כמעט אף פעם לא הטובה ביותר. הפיקו לפחות ארבע לפני שבוחרים.
להזין טקסט עברי בלי ניקוד ובלי טיפול. זו הסיבה מספר אחת לקריינות שנשמעת “רובוטית” ולזמר ששר מילים לא נכון. עשר דקות של הכנת טקסט חוסכות שעה של הרצות חוזרות.
לקרוא תסריט פודקאסט מילה במילה. נשמע כמו הרצאה בכפייה. מתווה עם נקודות ודיבור חופשי מנצחים תמיד.
להשאיר מוזיקת רקע חזקה מדי. המאזין מתאמץ לשמוע את הדיבור, ומתייאש אחרי דקה.
לשנות שלושה דברים בבת אחת כשמשהו לא עובד. שיניתם מילים, סגנון וטמפו יחד? לא תדעו מה תיקן ומה קלקל. שינוי אחד, הרצה אחת.
לדלג על בדיקת הזכויות. ג’ינגל שהפקתם בתוכנית חינמית ושידרתם ברדיו הוא בעיה משפטית שלא הייתם צריכים.
לשכוח את הפאנץ’ בסוף. קריינות ופודקאסט צריכים לסיים במשפט ברור, לא לדעוך. בקשו מהמודל “משפט סיום שנשמע כמו סיום”.
סיכום וצ’קליסט התחלה
הפקת אודיו עם AI היא בעיקר עבודת כתיבה ובחירה, לא עבודה טכנית. מי שיודע לנסח מה הוא רוצה, לתת למודל הקשר אמיתי, ולעבור על כמה גרסאות בסבלנות, יוצא עם תוצר שאפשר לפרסם. הציוד לא חסר לכם. מה שחסר זה ערב אחד של ניסיון.
הנה צ’קליסט לפרויקט הראשון שלכם:
לג’ינגל:
- בחרתי שורת מחץ אחת של עד 7 מילים, אחרי לפחות 8 הצעות
- המילים מנוקדות במלואן, מילים בעייתיות בתעתיק
- תיאור הסגנון באנגלית כולל ז’אנר, BPM, כלים, סוג קול ואווירה
- הפקתי לפחות 4 גרסאות לפני שבחרתי
- הורדתי גם גרסה אינסטרומנטלית לשימושים נוספים
- בדקתי שהתוכנית שלי מאפשרת שימוש מסחרי
לפודקאסט:
- יש לי מתווה עם נקודות, לא תסריט מלא
- הקלטתי בחדר קטן, מיקרופון במרחק אגרוף, 10 שניות שקט בהתחלה
- ערכתי דרך תמלול (Descript או דומה) ומחקתי חזרות ו“אממ”
- המודל כתב לי תיאור, כותרות, פרקים וציטוטים לרשתות
- ייצאתי MP3 מונו 128 kbps
לקריינות:
- הטקסט עבר המרה לתסריט מדובר: משפטים קצרים, גוף שני
- ראשי תיבות ומספרים נכתבו כמו שאומרים אותם
- מילים דו-משמעיות מנוקדות
- חילקתי לקטעים של 30 עד 60 שניות
- הקול הוא שלי או מספריית הכלי, לא של אדם אחר
לכולם:
- המוזיקה מתחת לדיבור חלשה ממה שנראה לי נכון
- שמעתי את התוצר באוזניות, ברמקול הטלפון וברכב
- ציינתי שימוש ב-AI במקום שזה רלוונטי
רוצים להמשיך? המדריך על יצירת תמונות ווידאו עם AI ישלים לכם את הצד הוויזואלי של הסרטון שהקריינות הזו הולכת לככב בו, והמדריך על שיווק לעסק קטן יסביר איפה הג’ינגל החדש שלכם צריך להתנגן.