כתוביות עבריות מקצועיות עם Whisper: איך קלוד קוד עושה את זה (לא CapCut)

תמלול עם המודל הגדול whisper-large-v3, חלוקה לכתוביות לפי משפטים ולא ספירת מילים, תיקון מונחים טכניים עקבי, ופתרון לבעיית ה-RTL שגורמת למילים לועזיות לשבור

כתוביות עבריות מקצועיות עם Whisper: איך קלוד קוד עושה את זה (לא CapCut)
מתוך הסדרה: קלוד כסוכן

בפרק הזה קלוד קוד בונה כתוביות עבריות עם Whisper - ובעמוד הזה יש את כל התהליך: שלבים מדויקים, טבלת השוואה ותשובות לשאלות הנפוצות.

🎬 לסרטון  ·  🛠️ ישר לשלבים  ·  ❓ שאלות נפוצות

🎬 הסרטון המלא של הפרק - בקרוב
בינתיים כל המדריך כתוב כאן למטה, שלב אחרי שלב.

Whisper הוא מודל תמלול שקלוד קוד מריץ כדי לבנות כתוביות עבריות מקצועיות לווידאו. מבקשים מקלוד לתמלל עם whisper-large-v3 כולל חותמות זמן ברמת מילה, והוא מחלק את הטקסט לכתוביות לפי משפטים, מתקן מונחים לפי רשימה קבועה ופותר את בעיית הכיוון של עברית ואנגלית באותה שורה. בסוף מתקבל קובץ SRT או VTT מוכן לטעינה בעורך.

בקצרה - מה בפרק:

  • תמלול עם whisper-large-v3, לא מודל קטן
  • חלוקה לכתוביות לפי משפטים, לא ספירת מילים
  • תיקון עקבי של מונחים לפי רשימה קבועה
  • פתרון לבעיית הכיוון של עברית ואנגלית
  • קובץ SRT או VTT מוכן בסוף התהליך
ציר זמן של עריכת וידאו על מסך מחשב
צילום: Peter Stumpf ב-Unsplash

כבר כתבנו כאן מדריך על כתוביות אוטומטיות בעברית עם Whisper דרך CapCut - זרימת עבודה נוחה למי שרוצה תוצאה מהירה בתוך עורך הווידאו. הפעם הזווית שונה. אני רוצה להראות מה קורה כשלא CapCut עושה את העבודה אלא קלוד קוד עצמו: מתמלל עם מודל Whisper הכי גדול ומדויק שיש, בונה כתוביות בחלוקה מקצועית של משפטים ולא נפילת מילים אקראית, מתקן מונחים טכניים שהמודל טועה בהם שוב ושוב, ופותר בעיה אמיתית שנתקלנו בה: כתוביות עבריות שמתפרקות ברגע שיש בהן מילה לועזית באמצע המשפט. זה לא "עוד כלי כתוביות". זה תהליך שקלוד מריץ בשבילכם, שלב אחרי שלב, ומתקן בעצמו את הדברים שכלים אוטומטיים רגילים משאירים שבורים.

למה בכלל צריך משהו מעבר לכתוביות האוטומטיות הרגילות

רוב הכלים שמייצרים כתוביות אוטומטיות עושים משהו פשוט: מריצים מודל תמלול קטן ומהיר, ואז מחלקים את הטקסט לשורות לפי קצב קבוע של מילים - נגיד חמש עד שבע מילים לשורה, בלי קשר לאיפה המשפט באמת נגמר. זה עובד סביר באנגלית. בעברית זה נשבר בכמה נקודות בו זמנית: המודל הקטן טועה יותר במונחים מקצועיים ובשמות, החלוקה למילים קבועות יוצרת שורות שנקטעות באמצע רעיון, ורגע שנכנסת מילה באנגלית - שם מותג, מונח טכני, כל דבר - הכיוון של הטקסט מתחיל להתהפך על המסך. קלוד קוד לא פותר את זה כי יש לו "מודל טוב יותר" בלבד. הוא פותר את זה כי הוא עושה את כל השלבים ברצף אחד: מתמלל, קורא את התמלול, מבין איפה המשפטים באמת נגמרים, בודק מול רשימת מונחים שאתם נותנים לו, ומתקן את בעיית הכיוון לפני שהקובץ יוצא.

בעיית ה-RTL שגורמת לכתוביות עבריות "להתפרק" באמצע

זו הבעיה שגרמה לנו הכי הרבה כאב ראש, ולכן היא בליבת המדריך הזה. כשמשפט עברי כולל בתוכו מילה באנגלית - למשל "עשינו קמפיין ב-Meta והתוצאות היו טובות" - עורכי כתוביות רבים (ובעיקר פורמטים כמו SRT שנצרבים בפלטפורמות שונות) לא תמיד מיישמים נכון את אלגוריתם ה-bidi (הכיווניות הדו-כיוונית) שקובע איך לסדר עברית ואנגלית יחד באותה שורה. התוצאה בפועל: המילה האנגלית "קופצת" למקום לא נכון, סימני פיסוק זזים לצד הלא נכון, ולפעמים כל הקטע שאחרי המילה הלועזית מתהפך בכיוון.

הפתרון שמצאנו עובד ופשוט: תעתוק מלא לעברית של כל מילה לועזית שמופיעה בתוך משפט עברי. במקום "עשינו קמפיין ב-Meta" כותבים "עשינו קמפיין במטא". כשכל השורה כתובה באותו כיוון כתיבה מההתחלה ועד הסוף, בעיית ה-bidi פשוט לא מתעוררת. קלוד קוד עושה את הצעד הזה אוטומטית כחלק מהתהליך: הוא סורק את הכתוביות, מזהה מילים לועזיות בתוך משפט עברי, ומציע תעתוק. אתם עוברים על ההצעות ומאשרים, כי לפעמים יש שם מותג שדווקא רוצים להשאיר באנגלית, ואז זה נשאר החלטה שלכם ולא אוטומציה עיוורת.

מתי דווקא כדאי להישאר עם CapCut

חשוב לומר את זה בכנות: אם אתם עורכים סרטון קצר לרשת ורוצים תוצאה תוך דקות, בלי להתעסק בקבצים ובתהליך, CapCut עדיין דרך מצוינת להתחיל - היא חינמית וזמינה לכולם. התהליך דרך קלוד קוד מתאים כשיש לכם כמות תוכן גדולה יותר (סדרת פרקים, קורס, וובינרים), כשיש מונחים מקצועיים שחוזרים שוב ושוב ואתם רוצים עקביות, או כשגיליתם שהכתוביות שיצאו לכם עד היום התפרקו בכל פעם שהוזכר שם מותג באנגלית.

שלב 1: תמלול עם whisper-large-v3, לא עם המודל הבסיסי

ל-Whisper יש כמה גדלים של מודל, מ-tiny ועד large. רוב הכלים האוטומטיים משתמשים במודל קטן כי הוא רץ מהר וזול. הבעיה היא שבעברית, שפה עם ניקוד לא כתוב וניואנסים של הטיה, ההבדל בדיוק בין מודל קטן לגדול מורגש חזק - במיוחד בהקלטות עם רעש רקע, כמה דוברים, או מונחים מקצועיים שלא נפוצים. כשקלוד קוד מריץ את התמלול, אני מבקש ממנו במפורש להשתמש ב-whisper-large-v3: המודל הגדול והמדויק ביותר בסדרה, כולל timestamps ברמת מילה בודדת, לא רק ברמת קטע. ה-timestamps האלה קריטיים לשלב הבא - בלעדיהם אי אפשר לדעת בדיוק מתי כל מילה נאמרה, ואי אפשר לבנות כתוביות שמסתנכרנות נכון עם הווידאו.

שלב 2: חלוקה לכתוביות לפי משפטים, לא לפי ספירת מילים

זה השלב שבו ההבדל מול כלי אוטומטי רגיל הכי בולט. כלי בסיסי מקבל טקסט עם timestamps ופשוט חותך אותו כל X מילים - בלי קשר לתחביר. התוצאה: משפט נחתך באמצע, פסיק שהיה אמור להפריד בין שני רעיונות נעלם בתוך שורה אחת. כשקלוד קוד עושה את החלוקה, הוא קורא את הטקסט המלא, מזהה גבולות טבעיים של משפטים ופסוקיות (נקודה, פסיק שמפריד רעיון, מילות חיבור כמו "אבל" או "כי"), ובונה על בסיס זה את הכתוביות. בנוסף הוא שומר על קצב קריאה סביר - בסביבות 15 עד 17 תווים לשנייה, לא יותר משתי שורות בכתובית, כדי שהצופה יספיק לקרוא בלי להרגיש שהטקסט "בורח" קדימה.

שלב 3: תיקון מונחים טכניים שהמודל תמיד טועה בהם

Whisper, גם בגרסה הגדולה, נתקל בקשיים עקביים עם מונחים שלא נפוצים בעברית מדוברת: שמות כלים (Meta, Claude, Shopify), ראשי תיבות (SEO, CRM, KPI), ומינוחים מקצועיים מהתחום שלכם. הפתרון שעובד לי הכי טוב: לפני שקלוד מריץ את התיקון, אני נותן לו רשימת מונחים קבועה - איך לכתוב כל שם, האם בעברית או באנגלית, ומה הכתיב הנכון. קלוד עובר על התמלול ומתקן לפי הרשימה הזו בעקביות בכל הקובץ, במקום שתצטרכו לתפוס כל טעות ידנית בעריכה.

שלבכלי כתוביות אוטומטי בסיסיקלוד קוד עם whisper-large-v3
מודל תמלוללרוב מודל קטן/בינוני, מהיר אבל פחות מדויקlarge-v3, המודל המדויק ביותר, עם timestamps ברמת מילה
חלוקה לשורותלפי ספירת מילים קבועה, בלי קשר לתחבירלפי גבולות משפט ופסוקית, עם בקרת קצב קריאה
מונחים טכנייםטעויות חוזרות בשמות ומונחים, תיקון ידני שורה-שורהתיקון עקבי לפי רשימת מונחים שנבנית פעם אחת
מילים לועזיות בתוך עבריתסיכון ל"שבירת" כיוון הטקסט (bidi)תעתוק מלא לעברית, כל שורה בכיוון כתיבה אחיד
עריכה חוזרתפותחים שוב את הכלי, עוברים ידנית על כל שורהמבקשים מקלוד בשיחה רגילה "תקן את השורה הזו" והוא מעדכן

איך מתחילים

  1. ודאו שיש לכם קובץ אודיו או וידאו נקי (אם זה וידאו, קלוד יכול לחלץ ממנו את פס הקול קודם).
  2. בקשו מקלוד קוד לתמלל את הקובץ עם מודל whisper-large-v3, כולל timestamps ברמת מילה - לא המודל הבסיסי שרץ כברירת מחדל בכלים רבים.
  3. תנו לו רשימת מונחים קבועה שחוזרת אצלכם: שמות כלים, ראשי תיבות, שמות מותג - איך כל אחד צריך להיכתב.
  4. בקשו לחלק את התמלול לכתוביות לפי משפטים ופסוקיות, עם קצב קריאה סביר, לא לפי ספירת מילים קבועה.
  5. בקשו לסרוק את הכתוביות ולתעתק לעברית כל מילה לועזית שמופיעה בתוך משפט עברי, ותאשרו את ההצעות אחת-אחת.
  6. קבלו קובץ SRT או VTT מוכן, עברו עליו עין אחת אחרונה מול הווידאו, וטענו לעורך שלכם.
  7. שמרו את רשימת המונחים בצד - בפרק הבא כבר לא תצטרכו לבנות אותה מחדש, רק לעדכן אם נוסף מונח חדש.

זה עבד לכם? יש עוד פרקים בסדרה

בפרק על Higgsfield אני מפיק עם קלוד פרסומת וידאו עקבית - בלי מצלמה ובלי צילומים.

לפרק על Higgsfield ←

עוד בסדרה: המרת קבצים עם קלוד · קמפיין Meta Ads מתוך קלוד

💾 שווה לשמור את העמוד - או לשלוח למי שהחיבור הזה יעשה לו סדר.

שאלות נפוצות

במה זה שונה מהמדריך הקודם שלכם על כתוביות ב-CapCut?
המדריך הקודם מתמקד בזרימת עבודה בתוך עורך הווידאו CapCut - כלי חינמי ונוח לסרטון בודד. המדריך הזה מתמקד בתהליך שקלוד קוד עצמו מריץ: מודל תמלול גדול יותר, חלוקה מקצועית לפי משפטים, תיקון מונחים עקבי ופתרון לבעיית ה-RTL. הם משלימים זה את זה, לא מחליפים.

אני צריך רקע טכני כדי להריץ את זה?
לא ברמת קוד. אתם צריכים גישה ל-Whisper (מותקן מקומית או דרך ספק חיצוני שמריץ אותו) וקלוד קוד. בפועל אתם מנהלים שיחה: "תמלל את הקובץ הזה, תחלק לכתוביות, תתקן את המונחים האלה". קלוד מבצע את השלבים הטכניים בעצמו.

מה זה בעצם בעיית ה-bidi ולמה היא קורה דווקא בכתוביות?
bidi (bidirectional text) הוא האלגוריתם שקובע איך לסדר על המסך טקסט שמערבב כיוון כתיבה מימין-לשמאל (עברית) עם כיוון משמאל-לימין (אנגלית). ברוב עורכי הטקסט הרגילים זה עובד טוב, אבל בפורמטים של כתוביות שנצרבים או מוצגים בפלייארים שונים, הטיפול בזה לא תמיד עקבי.

אם אני מתעתק הכל לעברית, זה לא פוגע במקצועיות של שמות מותג?
זו שאלת שיקול דעת ולא כלל אוטומטי. לרוב, תעתוק כמו "מטא" או "קלוד" נראה טבעי לגמרי לקהל עברי ואפילו יותר קריא. במקרים שבהם דווקא חשוב לשמור על שם באנגלית, קלוד מציע את התעתוק ואתם מחליטים אם לאשר אותו או להשאיר את המקור.

זה עובד גם על הקלטות עם רעש רקע או כמה דוברים?
whisper-large-v3 מתמודד עם זה משמעותית טוב יותר ממודלים קטנים, אבל לא בצורה מושלמת. בהקלטות עם רעש כבד או חפיפת דיבור, עדיין כדאי לעבור על התמלול הראשוני לפני שממשיכים לשלב החלוקה לכתוביות.

טיפ אחד לסיום

אם יש לכם כבר סדרת סרטונים או פרקים שיצאו עם כתוביות "שבורות" - מילים לועזיות שהתהפכו, מונחים שנכתבו אחרת בכל פרק - לא צריך להתחיל הכל מחדש. תנו לקלוד קוד את קובצי ה-SRT הקיימים ובקשו לעבור עליהם: לתקן את בעיית הכיוון, לאחד את הכתיב של המונחים החוזרים, ולשמור על אותה רשימת מונחים לכל הפרקים הבאים.

חזרה לכל המדריכים

הקהילה של המשווקים העצמאיים