פודקאסטים עם AI
AI לא מקליט במקומך — אבל הוא חוסך שעות בכל שלב אחר: תכנון, עריכה, תמלול והפצה.
איך AI עוזר בפודקאסט — ומה הוא לא עושה
הפקת פודקאסט מתחלקת לשני חלקים לא שווים בגודלם. החלק הראשון הוא ההקלטה עצמה: השיחה, הכימיה עם האורח, השאלה שנשאלה ברגע הנכון. החלק השני הוא כל מה שקורה אחריה — תמלול, עריכה, הסרת מילות מילוי, כתיבת show notes, חיתוך קליפים לרשתות, כתיבת תיאור ממוטב-חיפוש, העלאה. אצל רוב היוצרים החלק השני גוזל פי שלושה עד פי חמישה זמן מהחלק הראשון.
AI לא מקליט במקומך ולא מחליף את השיחה. מה שהוא כן עושה הוא לקחת את החלק השני כמעט במלואו. פרק של שעה שדרש בעבר ארבע-חמש שעות עבודה אחרי ההקלטה יכול לרדת לארבעים דקות של פיקוח, וזה ההבדל בין פודקאסט שיוצא פעם בשבוע לפודקאסט שנתקע אחרי שישה פרקים.
ההקלטה נשארת אנושית לגמרי. ה-AI לוקח את מה שבא אחריה — תמלול, עריכה, קליפים והפצה. הצינור שבמדריך הזה מבוסס כמעט כולו על כלים חינמיים שרצים מקומית.
שלב 1: תכנון והכנה
ההכנה היא המקום שבו AI נותן את התשואה הגבוהה ביותר ביחס למאמץ, פשוט כי היא מבוססת מחקר. לפני ראיון עם אורח, מודל שפה יכול לקרוא את הפרופיל שלו, פוסטים שכתב וראיונות קודמים, ולהחזיר לך זוויות שלא חשבת עליהן.
פרומפט להכנת ראיון
הטעות הנפוצה היא לבקש "שאלות לראיון" ולקבל עשר שאלות גנריות. הפרומפט צריך לדרוש במפורש את מה שאתה לא יכול לייצר לבד:
אתה עורך פודקאסט מנוסה. להלן רקע על האורח:
[הדבק ביו, 2-3 ראיונות קודמים, פוסטים אחרונים]
הפק לי:
1. שלוש טענות שהאורח חוזר עליהן בכל ראיון — אלה
השאלות שאסור לי לשאול, כי התשובה כבר מוכנה.
2. חמש שאלות שאף אחד לא שאל אותו, שנובעות
מסתירה או מפער בין דברים שאמר בזמנים שונים.
3. שני נושאים שבהם הוא כנראה יתנגד או יסתייג —
ואיך לנסח את השאלה כך שהוא בכל זאת יענה.
4. מונח מקצועי אחד שהוא ישתמש בו ושהמאזין
הממוצע לא מכיר, עם הסבר של משפט.
ההבדל בין הפרומפט הזה לבין "תן לי שאלות" הוא שהוא מבקש ניתוח, לא רשימה. סעיף 1 לבדו שווה את כל התרגיל — הוא מונע ממך לשרוף עשרים דקות על תשובה משומרת.
מתווה, לא תסריט
בקש שלד של שש עד שמונה נקודות עם סדר הגיוני, ולא רשימת שאלות מנוסחות. תסריט נוקשה נשמע נוקשה. מתווה מאפשר לך לעקוב אחרי השיחה ולחזור למסלול כשהיא נגמרת.
שלב 2: הקלטה — ההחלטות שקובעות אם AI יעזור
זה הסעיף שהכי הרבה מדריכים מדלגים עליו, והוא קריטי: איכות הקלט קובעת את כל מה שאחריו. תמלול על אודיו גרוע מייצר שגיאות שאתה תתקן ידנית, וזה מוחק את החיסכון בזמן.
- הקלט כל דובר לערוץ נפרד. זו ההחלטה הכי חשובה כאן. עם ערוצים נפרדים, זיהוי הדוברים הופך לטריוויאלי, ואפשר להסיר רעש מכל דובר בנפרד. Riverside, Zencastr ו-SquadCast עושים את זה כברירת מחדל.
- הקלט מקומית, לא דרך הרשת. שיחת זום דחוסה מגיעה ל-Whisper כאודיו פגום. הקלטה מקומית בכל צד ("double-ender") נותנת קובץ נקי.
- WAV ב-48kHz, לא MP3 128. אפשר תמיד לדחוס אחר כך; אי אפשר להחזיר מידע שנזרק.
- מחיאת כף בתחילת ההקלטה. נותנת נקודת סנכרון ברורה בין הערוצים.
- מיקרופון סביר גובר על כל תיקון AI. מיקרופון דינמי בסיסי בחדר עם וילון עדיף על מיקרופון יקר בחדר מהדהד.
הדהוד (reverb) הוא הדבר היחיד שכלי AI עדיין לא מסירים היטב. רעש רקע קבוע — מזגן, מאוורר — מוסר בקלות. הד מחדר ריק כמעט בלתי הפיך. אם יש לך רק תיקון אחד לעשות לפני ההקלטה הבאה, זה לתלות שמיכה מאחורי המיקרופון.
שלב 3: תמלול עם Whisper
התמלול הוא הבסיס לכל מה שבא אחריו — הוא מזין את העריכה, את ה-show notes, את הקליפים ואת ה-SEO. Whisper של OpenAI הוא עדיין ברירת המחדל, והוא רץ מקומית בחינם.
faster-whisper — הגרסה שכדאי להריץ
המימוש המקורי איטי. faster-whisper מהיר ממנו פי ארבעה בערך וצורך פחות זיכרון, עם אותה איכות:
pip install faster-whisper
from faster_whisper import WhisperModel
# large-v3 הוא המודל שנותן תוצאה טובה בעברית.
# int8 מאפשר להריץ אותו גם על CPU בלי GPU.
model = WhisperModel("large-v3", device="cpu", compute_type="int8")
segments, info = model.transcribe(
"episode-42.wav",
language="he", # אל תיתן לו לנחש - בעברית זה נכשל
vad_filter=True, # מדלג על שתיקות, מוריד זמן ריצה
word_timestamps=True, # נחוץ לחיתוך קליפים מדויק
initial_prompt="פודקאסט על אוטומציה, n8n, בינה מלאכותית ו-LLM.",
)
for s in segments:
print(f"[{s.start:7.2f} -> {s.end:7.2f}] {s.text}")
שתי השורות שעושות את ההבדל בעברית הן language="he" ו-initial_prompt. בלי הראשונה, Whisper לפעמים מזהה עברית כערבית או כפרסית ומחזיר ג'יבריש. השנייה היא טריק חשוב פחות מוכר: הטקסט שאתה נותן שם מטה את המודל לכיוון אוצר המילים שלך. אם הפודקאסט שלך מזכיר שוב ושוב "n8n", "LangChain" ו-"וקטור", כתוב אותם ב-initial_prompt — אחרת תקבל "אן-אייט-אן" ו"לאנג צ'יין".
מילון תיקונים
גם עם prompt טוב, שמות פרטיים ומונחים לועזיים בעברית ישתבשו. שווה להחזיק מילון קבוע ולהריץ אותו על כל תמלול:
REPLACEMENTS = {
"אן איט אן": "n8n",
"לאנג צ'יין": "LangChain",
"אמבדינג": "embedding",
"ראג": "RAG",
"קלוד": "Claude",
}
def fix_terms(text: str) -> str:
for wrong, right in REPLACEMENTS.items():
text = text.replace(wrong, right)
return text
זה נראה פרימיטיבי, והוא כן — אבל הוא חוסך את רוב זמן ההגהה, והוא צפוי לחלוטין, מה שלא נכון לגבי תיקון באמצעות מודל.
שלב 4: מי אמר מה — זיהוי דוברים
אם לא הקלטת בערוצים נפרדים, תצטרך diarization — חלוקת האודיו לדוברים. pyannote.audio הוא הסטנדרט הפתוח:
from pyannote.audio import Pipeline
pipeline = Pipeline.from_pretrained(
"pyannote/speaker-diarization-3.1",
use_auth_token=HF_TOKEN, # דורש אישור לתנאי המודל ב-Hugging Face
)
diarization = pipeline("episode-42.wav", num_speakers=2)
for turn, _, speaker in diarization.itertracks(yield_label=True):
print(f"{turn.start:6.1f}-{turn.end:6.1f} {speaker}")
הפרמטר num_speakers משפר משמעותית את הדיוק כשאתה יודע כמה אנשים היו בחדר. אם אתה לא בטוח, אפשר להשתמש ב-min_speakers ו-max_speakers במקום.
שים לב שזו הסיבה שהמלצתי על ערוצים נפרדים בשלב ההקלטה: diarization על ערוץ אחד מגיע לדיוק סביר אבל לא מושלם, במיוחד כששני דוברים מדברים יחד. עם ערוצים נפרדים אין כאן בעיה בכלל — כל ערוץ הוא דובר.
שלב 5: עריכה מבוססת טקסט
זה השינוי התפיסתי הגדול בעריכת אודיו. במקום לגרור בגלי קול, אתה מוחק שורות מהתמלול והאודיו נחתך בהתאם. Descript הפך את זה לפופולרי, אבל את הפעולה הבסיסית — הסרת שתיקות — אפשר לעשות בשורה אחת עם ffmpeg:
# מסיר שתיקות ארוכות מ-0.6 שניות שיורדות מתחת ל-35dB-
ffmpeg -i episode-42.wav \
-af "silenceremove=stop_periods=-1:stop_duration=0.6:stop_threshold=-35dB" \
episode-42-tight.wav
ולנרמול עוצמה לתקן הפודקאסטים המקובל (-16 LUFS לסטריאו):
ffmpeg -i episode-42-tight.wav \
-af "loudnorm=I=-16:TP=-1.5:LRA=11" \
-ar 44100 episode-42-final.wav
loudnorm הוא ההבדל בין פרק שנשמע חובבני לפרק שנשמע מקצועי, והוא עולה שנייה אחת של עבודה. פלטפורמות ההאזנה מנרמלות עוצמה בעצמן, ופרק שמוגש חלש מדי יישמע שטוח אחרי הנרמול שלהן.
הסרת מילות מילוי
אפשר לחתוך "אה" ו"אמ" אוטומטית לפי חותמות הזמן ברמת המילה שקיבלנו מ-Whisper. אבל שווה להיזהר: מחקר על תפיסת דיבור מראה שהסרה מוחלטת של מילות מילוי גורמת לשיחה להישמע מלאכותית. הכלל המעשי הוא להסיר רק רצפים — "אה... אה... אה" — ולהשאיר מילות מילוי בודדות.
שלב 6: Show notes אוטומטיים
עם תמלול ביד, יצירת show notes היא קריאה אחת למודל. הטריק הוא לבקש פלט מובנה ולא טקסט חופשי, כדי שתוכל להזין אותו ישירות ל-RSS ולאתר:
import anthropic, json
client = anthropic.Anthropic()
PROMPT = """להלן תמלול מלא של פרק פודקאסט, עם חותמות זמן.
החזר JSON בלבד במבנה:
{
"title": "כותרת בת 6-10 מילים, בלי מילים כמו 'מדהים'",
"summary": "שני משפטים, מה המאזין ילמד",
"chapters": [{"time": "MM:SS", "title": "..."}],
"quotes": ["ציטוט מדויק מהתמלול", ...],
"keywords": ["...", ...]
}
כללים:
- chapters: 5-9 פרקים, לפי מעברי נושא אמיתיים בלבד.
- quotes: 3 ציטוטים, מילה במילה מהתמלול. אל תמציא.
- אל תכתוב שום דבר מחוץ ל-JSON.
התמלול:
""" + transcript
msg = client.messages.create(
model="claude-opus-5",
max_tokens=2000,
messages=[{"role": "user", "content": PROMPT}],
)
notes = json.loads(msg.content[0].text)
שתי ההוראות החשובות כאן הן "לפי מעברי נושא אמיתיים בלבד" ו"מילה במילה מהתמלול. אל תמציא". בלעדיהן המודל ייצר פרקים בחלוקה שווה מלאכותית, ויכתוב ציטוטים שנשמעים נכון אבל לא נאמרו — וזה מביך במיוחד כשמצטטים אורח.
אחרי שקיבלת את ה-JSON, בדוק בקוד שכל ציטוט מופיע מילולית בתמלול — if quote not in transcript. זו בדיקה של שתי שורות שתופסת את ההזיה היחידה שבאמת מסוכנת כאן.
שלב 7: מציאת הקליפים
הקליפים הקצרים הם מה שמביא מאזינים חדשים — הפרק המלא הוא מה ששומר אותם. מציאת הרגעים הנכונים היא בדיוק המשימה שבה מודל שפה חזק על תמלול.
CLIP_PROMPT = """מצא בתמלול 5 קטעים באורך 30-60 שניות
שעומדים בכל התנאים:
- מובנים לגמרי בלי הקשר ממה שקדם להם
- מכילים טענה, מספר או סיפור - לא הכללה
- מתחילים במשפט שגורם לרצות לשמוע את הבא אחריו
לכל קטע החזר: start, end, hook (המשפט הפותח), why.
דרג לפי סיכוי לעצור גלילה. JSON בלבד."""
ואז חיתוך בפועל לפי הזמנים שחזרו, בפורמט אנכי לרשתות:
ffmpeg -ss 00:14:22 -to 00:15:05 -i episode-42-final.wav \
-c copy clip-01.wav
אם אתה מצלם וידאו, אותו חיתוך על קובץ הווידאו יחד עם כתוביות שנוצרות מהתמלול נותן קליף מוכן לפרסום. ראה וידאו עם AI להמשך התהליך.
שלב 8: לחבר הכול לצינור אחד
כל השלבים למעלה הם סקריפטים נפרדים, וזה בסדר לפרק אחד. מהפרק החמישי זה כבר מעיק. ב-n8n אפשר לחבר אותם לזרימה אחת שמופעלת ברגע שקובץ נכנס לתיקייה:
Webhook / Watch Folder ← קובץ אודיו חדש נכנס
↓
Execute Command ← ffmpeg: נרמול + הסרת שתיקות
↓
Execute Command ← faster-whisper: תמלול + מילון תיקונים
↓
Anthropic node ← show notes (JSON מובנה)
↓
Code node ← אימות: כל ציטוט קיים בתמלול?
↓
Anthropic node ← בחירת 5 קליפים
↓
Execute Command ← ffmpeg: חיתוך הקליפים
↓
Google Drive + Slack ← הכול לתיקייה + הודעה "מוכן לבדיקה"
שים לב לצומת האימות באמצע. אל תפרסם את הפלט אוטומטית. הזרימה צריכה להסתיים ב"מוכן לבדיקה", לא ב"פורסם" — התובנה הזאת עלתה לי בלמידה ממקרה בוחן אחר שבו זרימת פרסום אוטומטית לגמרי הוציאה תוכן שלא הייתי עומד מאחוריו.
כמה זה עולה
| שלב | כלי | עלות לפרק שעה |
|---|---|---|
| תמלול | faster-whisper מקומי | 0 ₪ (~8 דק' CPU) |
| תמלול | OpenAI Whisper API | ~1.3 ₪ |
| זיהוי דוברים | pyannote מקומי | 0 ₪ |
| עריכה ונרמול | ffmpeg | 0 ₪ |
| Show notes + קליפים | מודל שפה | ~2-4 ₪ |
כלומר צינור שרץ כמעט כולו מקומית עולה בין שקל לחמישה שקלים לפרק. השוואה מועילה: שירותי עריכת פודקאסט מסחריים מתחילים סביב 400 ₪ לפרק. ההבדל הוא שהם עושים גם שיפוט עריכתי, וזה בדיוק החלק שהצינור הזה לא עושה.
איזה מסלול לבחור — שלוש גישות
הצינור שתיארתי הוא הגישה המקומית, והיא לא מתאימה לכולם. שווה להיות ישיר לגבי מה שכל מסלול באמת נותן ומה הוא דורש בתמורה.
מסלול א': כלי הכול-באחד
Descript הוא הדוגמה המובהקת. אתה מעלה קובץ ומקבל תמלול, עריכה מבוססת טקסט, הסרת מילות מילוי בלחיצה, וייצוא קליפים — הכול בממשק אחד. העלות היא סביב 24 דולר לחודש, והתקרה היא שאתה עובד בתוך מה שהכלי מאפשר. אם הפודקאסט שלך בעברית, בדוק את איכות התמלול על פרק אמיתי לפני שאתה מתחייב למנוי שנתי — זה המקום שבו הכלים המסחריים נחלשים.
מסלול ב': פלטפורמת הקלטה עם AI מובנה
Riverside ו-Zencastr מקליטים מקומית בכל צד, מעלים אוטומטית, ומייצרים קליפים ותמלול. היתרון הגדול הוא שהם פותרים את בעיית איכות ההקלטה — שהיא, כזכור, הבעיה שקובעת את כל השאר. החיסרון הוא שהעיבוד שלהם הוא קופסה שחורה: אתה לא יכול להוסיף מילון תיקונים משלך.
מסלול ג': צינור מקומי
מה שתיארתי במדריך הזה. עולה כמעט כלום לפרק, נותן שליטה מלאה על התמלול והתיקונים, ורץ בלי תלות בשירות חיצוני. המחיר הוא הקמה ראשונית של כמה שעות, וזה שאתה מתחזק אותו. זו הבחירה הנכונה אם אתה מוציא פרקים בקביעות, אם העברית שלך מלאה במונחים מקצועיים, או אם אתה כבר מפעיל n8n ממילא.
המלצה מעשית: התחל במסלול ב' — הוא פותר את הבעיה החשובה ביותר, ההקלטה — והוסף אליו את חלק התמלול המקומי בלבד אם התמלול שלו לא מספיק טוב בעברית. אין סיבה לבנות את כל הצינור ביום הראשון.
מה מיוחד בפודקאסט בעברית
רוב מה שכתוב באינטרנט על AI לפודקאסטים נכתב עבור אנגלית, ושלושה דברים נשברים במעבר לעברית.
ראשית, שיעור השגיאה בתמלול גבוה יותר. Whisper אומן על הרבה פחות שעות עברית מאשר אנגלית, וזה מורגש בעיקר בשמות פרטיים, במונחים לועזיים ובמספרים. הפתרון הוא לא לוותר על התמלול האוטומטי אלא לבנות סביבו את שתי ההגנות שהוזכרו: initial_prompt עשיר במונחים שלך, ומילון תיקונים קבוע. יחד הם מורידים את ההגהה מ"לקרוא הכול" ל"לסרוק".
שנית, עברית ואנגלית מתערבבות בתוך משפט. "הרצתי את ה-workflow ב-n8n" הוא משפט תקין לגמרי בשיחה מקצועית בעברית, ומודלי תמלול מתקשים במעברי שפה בתוך משפט. כאן initial_prompt שכתוב באותו סגנון מעורב עוזר במידה ניכרת, כי הוא מראה למודל שזה הרישום הצפוי.
שלישית, כיווניות הטקסט. כשאתה מייצר כתוביות לקליפים, טקסט מעורב עברית-אנגלית מסודר לא נכון אם הכלי לא מטפל ב-RTL. בדוק קליף אחד לפני שאתה מייצר עשרים.
פרסום, RSS ו-SEO
הפודקאסט מתגלה בשני מקומות שונים לגמרי, ורוב היוצרים משקיעים רק באחד. הראשון הוא אפליקציות ההאזנה — Spotify, Apple Podcasts — שבהן הכותרת והתיאור הם כמעט כל מה שיש. השני הוא חיפוש רגיל, שאליו מגיעים דרך עמוד הפרק באתר שלך.
עמוד פרק שיש בו רק נגן הוא עמוד ריק מבחינת מנוע חיפוש. עמוד פרק עם התמלול המלא, חלוקה לפרקים וציטוטים הוא מסמך של אלפי מילים שאפשר למצוא בחיפוש. זו הסיבה הכי משכנעת להשקיע בתמלול, והיא לא קשורה לנגישות — אף שהיא כמובן משרתת גם אותה.
מה לכתוב בכותרת ובתיאור
- כותרת: נושא הפרק, לא מספרו. "#42" לא אומר כלום למי שלא מכיר. אם יש אורח, שמו שייך לכותרת.
- שלוש השורות הראשונות בתיאור: זה מה שנחתך בתצוגה. שים שם את מה שהמאזין ילמד, לא את הברכות.
- Timestamps בתיאור: משפרים משמעותית את שיעור ההשלמה, כי מאזין שמזהה נושא שמעניין אותו קופץ אליו במקום לנטוש.
- אל תמלא מילות מפתח. תיאור דחוס במונחים נקרא כספאם ולא עוזר בדירוג. ראה AI SEO.
אם התיאור וה-show notes נוצרים אוטומטית בשלב 6, כל זה כבר קורה — בתנאי שהפרומפט מבקש את זה במפורש. שווה להוסיף להוראות: "הכותרת לא תכיל את מספר הפרק. שלושת המשפטים הראשונים בתקציר יתארו מה המאזין ילמד."
מה למדוד
המספר שרוב היוצרים מסתכלים עליו — הורדות — הוא גם הכי פחות שימושי, כי הוא לא מבדיל בין מי ששמע דקה למי ששמע הכול. שלושה מספרים אומרים הרבה יותר:
- שיעור השלמה. כמה אחוז מהפרק נשמע בממוצע. אם הוא צונח בעקביות סביב הדקה החמישית, האינטרו שלך ארוך מדי.
- נקודת הנטישה. לא הממוצע אלא איפה אנשים עוצרים. השווה אותה לחלוקת הפרקים שה-AI ייצר — לרוב תגלה שהנטישה נופלת בדיוק על מעבר נושא חלש.
- מאזינים חוזרים מול חדשים. קליפים מזיזים את החדשים; איכות הפרק מזיזה את החוזרים. אם אתה משקיע בקליפים ורואה רק חדשים שלא חוזרים, הבעיה היא בפרק ולא בהפצה.
מאיפה להתחיל
אם אתה מפיק פודקאסט היום ידנית, אל תבנה את כל הצינור בבת אחת — זו דרך בטוחה לא לסיים. הסדר שמחזיר הכי הרבה זמן בהכי מעט מאמץ:
- שבוע 1 — תמלול. הרץ
faster-whisperעל הפרק האחרון שלך. זה לבדו פותח את כל השאר. - שבוע 2 — נרמול והסרת שתיקות. שתי פקודות
ffmpeg. השיפור באיכות הנתפסת גדול ביחס למאמץ. - שבוע 3 — show notes. קריאה אחת למודל עם הפרומפט המובנה, כולל בדיקת הציטוטים.
- שבוע 4 — קליפים. רק עכשיו, כשכל השאר עובד ואתה סומך על התמלול.
- אחר כך — לחבר ל-n8n. רק כשכל שלב עובד בנפרד ואתה יודע איך הוא נכשל.
הכלל שמנחה את הסדר הזה הוא שכל שלב כאן מסתמך על התמלול, ולכן שווה להשקיע קודם בכך שהתמלול יהיה טוב. צינור שבנוי על תמלול בינוני מייצר show notes בינוניים וקליפים שחתוכים במקום הלא נכון, ואז אתה מבלה יותר זמן בתיקון מאשר חסכת.
טעויות נפוצות
- לסמוך על התמלול בעיוורון. בדוק שמות, מספרים ומונחים לועזיים — בעברית שיעור השגיאה בהם גבוה במיוחד. מילון תיקונים קבוע פותר את רובם.
- עריכת יתר. הסרת כל מילת מילוי הופכת שיחה לקריינות. הסר רצפים, השאר בודדים.
- לדלג על הנרמול.
loudnormהוא שנייה של עבודה והוא ההבדל הכי גדול בין חובבני למקצועי. - לפרסם ציטוטים בלי אימות. מודל שמצטט אורח לא מדויק הוא בעיה אמיתית, לא אסתטית. בדוק מחרוזת.
- להזניח קליפים. הפרק המלא שומר מאזינים, הקליפים מביאים חדשים. אלה שתי עבודות שונות.
- לתקן באודיו מה שאפשר למנוע בהקלטה. חצי שעה של טיפול אקוסטי בחדר חוסכת יותר מכל כלי AI.