הסרטון כבר מצולם, עכשיו העבודה האמיתית: עריכת וידאו עם AI בלי ללמוד תוכנת עריכה
איך לקחת הקלטה גולמית של הרצאה, וובינר או סרטון לרשתות ולהפוך אותה לתוצר נקי: חיתוך שקטים, כתוביות בעברית שנראות טוב, סאונד משופר וקליפים קצרים מתוך שעה שלמה — בטלפון ובמחשב, בלי ציר זמן ובלי פריים-ביי-פריים.
יש לכם בטלפון הרצאה של שעה שהעברתם, וובינר מזום, סרטון שצילמתם למרפסת של הלקוח, או ארבעים דקות של “בוא נדבר על זה למצלמה” שהבטחתם לעצמכם שתעלו לרשתות. הסרטון קיים. מה שעוצר אותו הוא העריכה: לחתוך את השתיקות, להוריד את ה“אממ”, להוסיף כתוביות (כי 80% מהצופים בפיד רואים בלי סאונד), לתקן את ההד של החדר, ולהפוך שעה לחמישה קליפים של דקה.
עד לא מזמן זה חייב אחת משתיים: ללמוד Premiere או DaVinci במשך חודש, או לשלם לעורך 400–800 שקל לשעת תוצר. המדריך הזה מציע דרך שלישית. הרעיון המרכזי פשוט: במקום לערוך וידאו, אתם עורכים טקסט. ה-AI מתמלל את הסרטון, אתם עובדים על התמלול כמו על מסמך, והכלים מבצעים את החיתוכים בשבילכם. כל מה שצריך לדעת הוא איך לדבר עם הכלים, ולא איפה הכפתור.
המדריך מתאים למרצים, יוצרי תוכן, בעלי עסקים קטנים, מורים, מאמנים ולכל מי שיש לו הקלטות שתופסות מקום ולא רואות אור. אין פה יצירת וידאו מאפס (לזה יש מדריך נפרד ב-/guides), רק עבודה על חומר שכבר צילמתם.
העיקרון שמשנה הכל: התמלול הוא ציר הזמן שלכם
בעריכה מסורתית אתם מסתכלים על גל סאונד ומחפשים איפה נגמר המשפט. בעריכה מבוססת AI, הצעד הראשון תמיד זהה: מתמללים את כל הסרטון. מרגע שיש תמלול עם חותמות זמן, כל שאר העבודה הופכת לעבודה על טקסט, וזה בדיוק מה ש-ChatGPT, Claude ו-Gemini מצטיינים בו.
איפה מקבלים תמלול עם חותמות זמן, בלי לשלם לאנשים:
- בטלפון: אפליקציות עריכה כמו CapCut מייצרות כתוביות אוטומטיות, וזה בפועל תמלול עם זמנים. ניתן לייצא אותו כקובץ SRT.
- במחשב: Descript הוא הכלי המזוהה ביותר עם “עריכת וידאו כטקסט”. מעלים סרטון, מקבלים תמלול, ומחיקת מילה מהתמלול מוחקת אותה מהווידאו. עברית נתמכת אך באיכות פחותה מאנגלית, אז צפו לתיקונים.
- בחינם לחלוטין: העלאה ליוטיוב כסרטון פרטי (לא רשום) מייצרת כתוביות אוטומטיות בעברית, שאותן אפשר להוריד כקובץ.
- דרך Gemini: Gemini מקבל קובץ וידאו ישירות ויודע לענות על שאלות עליו עם ציון זמנים. זה לא תמלול מדויק מילה-במילה, אבל זה הכלי הטוב ביותר לניווט בשעה של חומר (על זה בהמשך).
טיפ שחוסך שעות: אם תמללתם בכלי אחד וקיבלתם קובץ SRT מלא שגיאות, אל תתקנו ידנית. הדביקו אותו ל-Claude או ChatGPT עם הפרומפט הזה:
זה קובץ כתוביות SRT של הרצאה בעברית על [הנושא]. התמלול האוטומטי עשה שגיאות, בעיקר בשמות ובמונחים מקצועיים.
המונחים הנכונים: [רשימה: שמות אנשים, מוצרים, מונחים].
תקן את הטקסט בלבד. אל תשנה את מספרי השורות ואת חותמות הזמן אפילו בתו אחד.
הוסף פיסוק נכון, פצל משפטים ארוכים מדי, ואל תוסיף שום דבר שלא נאמר.
החזר את הקובץ המלא בפורמט SRT תקין.
הדגישו את “אל תשנה את חותמות הזמן”. זו הטעות הכי נפוצה של מודלים: הם “מסדרים” גם את המספרים, והכתוביות יוצאות מסנכרון.
לחתוך שקטים, “אממ” ומילות מילוי
שקט של שתי שניות באמצע משפט נראה נצחי בסרטון. מרצה ממוצע אומר “אממ”, “כאילו”, “בעצם” ו“אוקיי” בין 4 ל-8 פעמים בדקה. הסרה ידנית של כל אלה משעת הרצאה היא עבודה של יום שלם. ב-AI זה שתי פעולות.
במחשב (Descript): אחרי התמלול, יש פעולה של הסרת מילות מילוי שמסמנת את כולן בלחיצה אחת ומאפשרת למחוק את כולן יחד. בנפרד, יש פעולה של קיצור שקטים שמגדירים לה סף (למשל “כל הפסקה מעל 1.2 שניות תקוצר ל-0.4”). זה רוב העבודה של עורך מקצועי בפודקאסט, בדקה.
בטלפון: חלק מאפליקציות העריכה מציעות זיהוי שקטים והסרה אוטומטית. אם האפליקציה שלכם לא מציעה את זה, השיטה העקיפה עובדת מצוין: ייצרו כתוביות אוטומטיות, ואז מחקו את הקטעים של הכתוביות שאתם לא רוצים. רוב האפליקציות חותכות את הווידאו יחד עם הכתובית.
שתי הגדרות שכדאי לדעת:
- אל תקצרו שקטים לאפס. דיבור אנושי צריך נשימה. קיצור ל-0.3–0.5 שניות נשמע חד ומקצועי. קיצור ל-0 נשמע כמו מישהו שנושם דרך הקיר.
- אל תמחקו כל “אממ”. אם דיברתם בלהט והייתה הפסקה דרמטית לפני נקודה חשובה, זה לא באג, זו רטוריקה. עברו על הרשימה לפני המחיקה ההמונית וסמנו 3–4 מקומות לשמור.
אם אתם רוצים שה-AI יעזור להחליט מה למחוק, העתיקו את התמלול ושאלו:
זה תמלול של סרטון שאני רוצה לקצר. סמן לי בסוגריים מרובעים שלושה סוגי קטעים:
[חזרה] – מקום שבו אמרתי את אותו רעיון פעמיים.
[סטייה] – אנקדוטה או הערה שלא משרתת את המסר המרכזי.
[אפשר לוותר] – משפטי מעבר ריקים כמו "אוקיי אז בואו נמשיך".
אל תמחק כלום בעצמך. רק סמן, ואחרי כל סימון כתוב במילה אחת למה.
היתרון: אתם נשארים בשליטה. המודל מציע, אתם מחליטים, והחיתוך נעשה בכלי לפי חותמות הזמן.
כתוביות בעברית שבאמת נראות טוב
זה הסקשן שבגללו רוב האנשים נכנסו למדריך, ובצדק: כתוביות בעברית הן מכשול שאפילו כלים גדולים נופלים בו. הנה מה שמשתבש ואיך לפתור.
בעיה 1: הטקסט יוצא הפוך או עם פיסוק בצד הלא נכון. זו בעיית RTL (כתיבה מימין לשמאל). סימני שאלה ונקודות “קופצים” לתחילת השורה, ומספרים ומילים באנגלית מתערבבים. פתרון: בדקו אם לאפליקציה יש הגדרה של “כיוון טקסט” או “RTL” בסגנון הכתובית. אם אין, פתרון עוקף שעובד תמיד: בקשו מה-AI להזיז את הפיסוק באופן שיראה נכון בכלי שלכם, ותנו לו דוגמה של שורה אחת שכבר תיקנתם ידנית. זהו. הוא יחזור על התיקון על כל הקובץ.
בעיה 2: שורות ארוכות מדי. תמלול אוטומטי יוצר כתוביות של 15 מילים שמכסות חצי מסך. כלל אצבע לרשתות: עד 6–7 מילים בשורה, עד שתי שורות, ועד 3 שניות לכתובית. בקשו מ-Claude:
פצל מחדש את קובץ ה-SRT הזה כך שכל כתובית תהיה עד 7 מילים ועד שתי שורות.
חלק את חותמות הזמן באופן יחסי לאורך הטקסט (כתובית ארוכה מקבלת יותר זמן).
אל תפצל באמצע צירוף סמיכות או באמצע שם. שמור על פיסוק בסוף כתובית רק כשהמשפט באמת נגמר.
בעיה 3: מילים באנגלית בתוך העברית. “השתמשתי ב-ChatGPT” הופך ל-“ChatGPT-ב השתמשתי”. אם הכלי שלכם לא מטפל בזה, ההחלטה הפשוטה ביותר היא לתעתק: “צ’אט ג’י-פי-טי”. זה נראה קצת מוזר בכתב, אבל נראה מושלם על המסך, ולקורא בפיד זה עובד.
בעיה 4: כתוביות שמסתירות את הפנים או את הגרפיקה. לפני שאתם מייצאים, ודאו שהכתובית יושבת בשליש התחתון, עם רקע חצי שקוף או הילה שחורה דקה (Outline). כתובית לבנה על חולצה לבנה היא כתובית שלא קיימת.
שתי אסטרטגיות ייצוא, ולמה לבחור:
- כתוביות “שרופות” (Burned-in): הטקסט הוא חלק מהווידאו. חובה לאינסטגרם, טיקטוק ולינקדאין, שם אין העלאת קובץ כתוביות נפרד לריל. החיסרון: אי אפשר לתקן אחרי הפרסום.
- קובץ SRT נפרד: ליוטיוב, לקורס מקוון, לאתר. אפשר לתקן בכל רגע, הצופה יכול לכבות, והחיפוש של יוטיוב קורא את הטקסט. אם אתם מעלים ליוטיוב, תמיד העלו קובץ SRT במקום להסתמך על האוטומטי, גם אם האוטומטי היה הבסיס.
טיפ פחות מוכר: כתוביות הן גם סיכום. אחרי שניקיתם את ה-SRT, בקשו מ-ChatGPT להפוך את התמלול הנקי לתיאור סרטון, לרשימת “פרקים” עם חותמות זמן ליוטיוב ולפוסט לינקדאין. עשיתם את העבודה הקשה פעם אחת, קבלו ממנה ארבעה תוצרים.
לשפר סאונד בלי לדעת מה זה אקולייזר
צופים סולחים לתמונה בינונית. הם לא סולחים לסאונד רע. החדשות הטובות: שיפור סאונד של דיבור הוא הדבר שה-AI עושה הכי טוב ובמאמץ הכי קטן.
הכלי הראשון לנסות, בחינם: Adobe Podcast Enhance Speech. מעלים קובץ אודיו (או שולפים אודיו מהסרטון), ומקבלים חזרה קול שנשמע כאילו הוקלט באולפן: הד החדר נעלם, המזגן נעלם, הקול נהיה מלא יותר. יש מחוון “עוצמה” של האפקט, ועדיף להתחיל סביב 60–70% ולא על מקסימום, כי על מקסימום הקול מתחיל להישמע מלאכותי, עם “בליעות” של סופי מילים.
בתוך כלי העריכה: ב-Descript זה נקרא Studio Sound ועושה דבר דומה בתוך הפרויקט. ב-CapCut ובאפליקציות טלפון יש בדרך כלל “הפחתת רעש” ו“שיפור קול”, פחות חזקים אבל מספיקים להקלטה בחדר סביר.
איך להחזיר את האודיו לסרטון בלי תוכנת עריכה: רוב עורכי הטלפון והדפדפן מאפשרים “להשתיק את האודיו המקורי” ולהוסיף קובץ אודיו כרצועה. כיוון ששני הקבצים מתחילים באותה שנייה, הם יסתנכרנו אוטומטית אם לא חתכתם כלום לפני השלב הזה. לכן הסדר קריטי: סאונד קודם, חיתוכים אחרי. אם חתכתם ואז החלפתם אודיו, תקבלו שפתיים שזזות בלי התאמה.
מתי לא לשפר: אם ההקלטה כוללת מוזיקה, קהל צוחק, או יותר מדובר אחד שמדברים במקביל, כלי שיפור הדיבור עלולים “לנקות” בדיוק את מה שרציתם לשמור. הרצאה עם שאלות מהקהל: הריצו את השיפור, האזינו דווקא לקטעי השאלות, ואם הן נעלמו, הורידו את העוצמה או חזרו למקור.
בונוס של 30 שניות: אחרי השיפור, בקשו מהכלי “נרמול עוצמה” (Normalize) אם קיים. זה משווה את הווליום כך שאתם לא תצעקו בהתחלה ותלחששו בסוף. ברשתות, סרטון שקט מדי פשוט מגוללים הלאה.
מהרצאה של שעה לשמונה קליפים שאנשים באמת עוצרים עליהם
זה השימוש עם התמורה הגבוהה ביותר: שעת תוכן אחת יכולה להיות חודש של פרסומים. יש שתי דרכים, ועדיף לשלב.
דרך א’: לתת ל-AI לצפות. Gemini מקבל העלאת קובץ וידאו ארוך ישירות (ב-Google AI Studio או באפליקציה, בהתאם למנוי ולאורך) ועונה על שאלות עם ציון זמנים. העלו את ההרצאה ושאלו:
צפית בהרצאה באורך שעה בנושא [הנושא]. אני רוצה להפיק ממנה קליפים של 45–90 שניות לאינסטגרם וללינקדאין.
מצא לי 8 קטעים שעומדים בפני עצמם: מתחילים בטענה או בשאלה, לא מסתמכים על מה שנאמר קודם, ונגמרים במשפט סיום ברור.
לכל קטע כתוב: זמן התחלה וסיום, המשפט הראשון שנאמר בו, על מה הוא, ולמה הוא יעבוד כקליפ.
תעדף קטעים שיש בהם דעה לא מובנת מאליה, מספר מפתיע, או סיפור קצר. הימנע מקטעים שהם "הקדמה ל..." או "כמו שאמרתי קודם".
דרך ב’: לעבוד על התמלול. אם אין לכם גישה להעלאת וידאו, או שהסרטון ארוך מדי, הדביקו את ה-SRT הנקי ל-Claude או ChatGPT עם פרומפט דומה. חותמות הזמן כבר בטקסט, והמודל יחזיר לכם טווחים מדויקים. היתרון של Claude כאן הוא חלון הקשר הגדול: תמלול של שעה נכנס בשלמותו בלי לפצל.
דרך ג’: כלים ייעודיים. Opus Clip, Munch ודומיהם מקבלים סרטון ארוך ומחזירים קליפים גזורים, עם כתוביות ועם פריים אנכי ממורכז על הדובר. הם חוסכים את שלב הגזירה, אבל הבחירה שלהם גנרית (הם אוהבים משפטים עם מספרים ומילות הפעלה). השיטה המנצחת: תנו להם לגזור, ואז השתמשו ברשימה ש-Gemini או Claude הכינו כדי לבחור אילו מהקליפים שווים פרסום, ולבקש גזירה ידנית של 2–3 קטעים שהכלי פספס.
אחרי הגזירה, שלושה שיפורים שהופכים קליפ סביר לקליפ טוב:
- ה-Hook. שלוש השניות הראשונות מחליטות. אם הקטע מתחיל ב“אז, עוד נקודה שרציתי להגיד”, חתכו ישר לטענה. בקשו מה-AI: “לכל קליפ, הצע כותרת-על של עד 6 מילים שתופיע בשניות הראשונות, בצורת טענה או שאלה, בלי קליקבייט”. כותרת-על מוסיפים בכל אפליקציית עריכה כטקסט רגיל.
- סיום נקי. קליפ שנגמר באמצע נשימה מרגיש כטעות. חפשו נקודה שבה הדובר סיים משפט ועצר, והאריכו את הקליפ בחצי שנייה אחריה.
- פריים אנכי. הרצאה מצולמת אופקית. כשהופכים לאנכי, ודאו שהדובר במרכז בכל הקליפ. כלים ייעודיים עושים זאת אוטומטית; באפליקציה רגילה אתם ממקמים ידנית, וזה עשר שניות לקליפ.
תהליך עבודה מלא: משעת הקלטה לתוצרים מוכנים
כך זה נראה בפועל, בסדר הנכון, עם זמני עבודה ריאליים למתחילים:
| שלב | מה עושים | כלי לדוגמה | זמן |
|---|---|---|---|
| 1 | שיפור סאונד על הקובץ המלא | Adobe Podcast Enhance / Studio Sound | 10 דק’ (רובו המתנה) |
| 2 | תמלול וקבלת SRT | Descript / CapCut / יוטיוב פרטי | 10 דק’ |
| 3 | ניקוי התמלול עם רשימת מונחים | Claude / ChatGPT | 10 דק’ |
| 4 | מחיקת מילות מילוי וקיצור שקטים | Descript / עורך טלפון | 15 דק’ |
| 5 | מציאת 8 קטעים לקליפים | Gemini (וידאו) או Claude (תמלול) | 10 דק’ |
| 6 | גזירה, פריים אנכי, כותרת-על | כלי קליפים / CapCut | 30 דק’ |
| 7 | כתוביות בעברית, בדיקת RTL, ייצוא | CapCut / Descript | 20 דק’ |
| 8 | תיאורים, פרקים ופוסטים מהתמלול | ChatGPT / Claude | 10 דק’ |
כשעתיים בפעם הראשונה, כשעה מהפעם השלישית. מהצד השני יוצאים: הרצאה מלאה נקייה ליוטיוב, קובץ כתוביות, 8 קליפים, ותוכן כתוב לשבועיים.
איך לחסוך את החצי הראשון בפעם הבאה: שמרו את רשימת המונחים והשמות שלכם כהוראה קבועה ב-Project של Claude או ב-Custom Instructions של ChatGPT. בפעם הבאה הניקוי יהיה מדויק מהניסיון הראשון.
טעויות נפוצות
- לחתוך לפני לשפר סאונד. החלפת אודיו אחרי חיתוכים שוברת את הסנכרון. תמיד סאונד ראשון.
- לסמוך על התמלול האוטומטי בעברית בלי לבדוק שמות. “יוסי כהן” הופך ל“יוסי כואן”, שם המוצר שלכם הופך למילה אחרת, וזה מתפרסם. רשימת מונחים לפני הניקוי פותרת 90% מזה.
- לתת למודל “לסדר” גם את חותמות הזמן. כל פרומפט על SRT חייב לכלול במפורש: אל תיגע בזמנים.
- לדחוף את שיפור הסאונד למקסימום. קול שנשמע “רובוטי” או בולע סופי מילים הוא סימן שעברתם את הגבול. 60–70% הוא המקום.
- כתוביות צפופות. 15 מילים בשורה בעברית הן קיר טקסט. 7 מילים, שתי שורות, 3 שניות.
- קליפ שמתחיל ב“כמו שאמרתי”. קליפ חייב לעמוד לבד. אם הצופה צריך הקשר, הוא לא נשאר לקבל אותו.
- להעלות סרטון של לקוח או של קהל לכלי ענן בלי לחשוב. הרצאה עם שאלות מהקהל, מפגש עם מטופל או שיעור עם ילדים הם מידע אישי של אנשים אחרים. לפני העלאה לכלי AI, בדקו אם יש לכם הסכמה, ובדקו את הגדרות הפרטיות והאימון של הכלי. ב-/guides יש מדריך נפרד על פרטיות מול כלי AI.
- לייצא הכל באותה איכות. ליוטיוב ייצאו ב-1080p לפחות. לסטורי ולריל, 1080x1920 מספיק והקובץ קטן בהרבה. ייצוא של 4K לאינסטגרם רק מאריך את ההעלאה.
- לשכוח שהתמלול הוא נכס. סיימתם לערוך ומחקתם את ה-SRT? זרקתם את תיאור הסרטון, את הפוסטים ואת הפרקים. שמרו אותו לצד הסרטון.
סיכום וצ’קליסט התחלה
הפיצוח הוא לא ללמוד עריכה אלא לשנות נקודת מבט: הסרטון הוא מסמך. מתמללים, עובדים על הטקסט עם ChatGPT, Claude או Gemini, והכלים מבצעים את החיתוכים. סאונד משפרים בלחיצה, כתוביות מנקים בפרומפט אחד, וקליפים מוצאים עם שאלה אחת לכלי שצפה בסרטון בשבילכם.
צ’קליסט לסרטון הראשון:
- בחרתי סרטון אחד קצר יחסית (10–20 דקות) להתנסות, לא את ההרצאה החשובה ביותר.
- הוצאתי את האודיו והרצתי שיפור דיבור ב-60–70%, והאזנתי לדקה אחת לפני ואחרי.
- קיבלתי תמלול עם חותמות זמן כקובץ SRT.
- הכנתי רשימה של שמות ומונחים שמופיעים בסרטון.
- ניקיתי את ה-SRT עם פרומפט שכולל “אל תשנה את חותמות הזמן”.
- מחקתי מילות מילוי וקיצרתי שקטים ל-0.3–0.5 שניות, ושמרתי 3 הפסקות מכוונות.
- פיצלתי כתוביות ל-7 מילים בשורה ובדקתי שסימני הפיסוק בצד הנכון.
- ביקשתי מ-Gemini או Claude רשימת 5–8 קטעים לקליפים עם זמנים והסבר.
- גזרתי קליפ אחד, הוספתי כותרת-על של עד 6 מילים, ובדקתי שהוא מתחיל בטענה ונגמר בסוף משפט.
- שמרתי את ה-SRT הנקי ואת רשימת המונחים לפעם הבאה.
סרטון ראשון ייקח לכם ערב. השלישי ייקח שעה. ומהרביעי כבר תתחילו לצלם אחרת, כי תדעו שכל מה שתגידו למצלמה יגיע לצופים נקי, מסונכרן ומכותב, בלי שאף אחד יצטרך לפתוח ציר זמן.