דלג לתוכן הראשי
יצירת תוכן פודקאסטים עם AI
רמה: מתקדם עודכן: אוגוסט 2026

פודקאסטים עם AI

AI לא מקליט במקומך — אבל הוא חוסך שעות בכל שלב אחר: תכנון, עריכה, תמלול והפצה.

איך AI עוזר בפודקאסט — ומה הוא לא עושה

הפקת פודקאסט מתחלקת לשני חלקים לא שווים בגודלם. החלק הראשון הוא ההקלטה עצמה: השיחה, הכימיה עם האורח, השאלה שנשאלה ברגע הנכון. החלק השני הוא כל מה שקורה אחריה — תמלול, עריכה, הסרת מילות מילוי, כתיבת show notes, חיתוך קליפים לרשתות, כתיבת תיאור ממוטב-חיפוש, העלאה. אצל רוב היוצרים החלק השני גוזל פי שלושה עד פי חמישה זמן מהחלק הראשון.

AI לא מקליט במקומך ולא מחליף את השיחה. מה שהוא כן עושה הוא לקחת את החלק השני כמעט במלואו. פרק של שעה שדרש בעבר ארבע-חמש שעות עבודה אחרי ההקלטה יכול לרדת לארבעים דקות של פיקוח, וזה ההבדל בין פודקאסט שיוצא פעם בשבוע לפודקאסט שנתקע אחרי שישה פרקים.

בקצרה

ההקלטה נשארת אנושית לגמרי. ה-AI לוקח את מה שבא אחריה — תמלול, עריכה, קליפים והפצה. הצינור שבמדריך הזה מבוסס כמעט כולו על כלים חינמיים שרצים מקומית.

שלב 1: תכנון והכנה

ההכנה היא המקום שבו AI נותן את התשואה הגבוהה ביותר ביחס למאמץ, פשוט כי היא מבוססת מחקר. לפני ראיון עם אורח, מודל שפה יכול לקרוא את הפרופיל שלו, פוסטים שכתב וראיונות קודמים, ולהחזיר לך זוויות שלא חשבת עליהן.

פרומפט להכנת ראיון

הטעות הנפוצה היא לבקש "שאלות לראיון" ולקבל עשר שאלות גנריות. הפרומפט צריך לדרוש במפורש את מה שאתה לא יכול לייצר לבד:

אתה עורך פודקאסט מנוסה. להלן רקע על האורח:
[הדבק ביו, 2-3 ראיונות קודמים, פוסטים אחרונים]

הפק לי:
1. שלוש טענות שהאורח חוזר עליהן בכל ראיון — אלה
   השאלות שאסור לי לשאול, כי התשובה כבר מוכנה.
2. חמש שאלות שאף אחד לא שאל אותו, שנובעות
   מסתירה או מפער בין דברים שאמר בזמנים שונים.
3. שני נושאים שבהם הוא כנראה יתנגד או יסתייג —
   ואיך לנסח את השאלה כך שהוא בכל זאת יענה.
4. מונח מקצועי אחד שהוא ישתמש בו ושהמאזין
   הממוצע לא מכיר, עם הסבר של משפט.

ההבדל בין הפרומפט הזה לבין "תן לי שאלות" הוא שהוא מבקש ניתוח, לא רשימה. סעיף 1 לבדו שווה את כל התרגיל — הוא מונע ממך לשרוף עשרים דקות על תשובה משומרת.

מתווה, לא תסריט

בקש שלד של שש עד שמונה נקודות עם סדר הגיוני, ולא רשימת שאלות מנוסחות. תסריט נוקשה נשמע נוקשה. מתווה מאפשר לך לעקוב אחרי השיחה ולחזור למסלול כשהיא נגמרת.

שלב 2: הקלטה — ההחלטות שקובעות אם AI יעזור

זה הסעיף שהכי הרבה מדריכים מדלגים עליו, והוא קריטי: איכות הקלט קובעת את כל מה שאחריו. תמלול על אודיו גרוע מייצר שגיאות שאתה תתקן ידנית, וזה מוחק את החיסכון בזמן.

מלכודת נפוצה

הדהוד (reverb) הוא הדבר היחיד שכלי AI עדיין לא מסירים היטב. רעש רקע קבוע — מזגן, מאוורר — מוסר בקלות. הד מחדר ריק כמעט בלתי הפיך. אם יש לך רק תיקון אחד לעשות לפני ההקלטה הבאה, זה לתלות שמיכה מאחורי המיקרופון.

שלב 3: תמלול עם Whisper

התמלול הוא הבסיס לכל מה שבא אחריו — הוא מזין את העריכה, את ה-show notes, את הקליפים ואת ה-SEO. Whisper של OpenAI הוא עדיין ברירת המחדל, והוא רץ מקומית בחינם.

faster-whisper — הגרסה שכדאי להריץ

המימוש המקורי איטי. faster-whisper מהיר ממנו פי ארבעה בערך וצורך פחות זיכרון, עם אותה איכות:

pip install faster-whisper

from faster_whisper import WhisperModel

# large-v3 הוא המודל שנותן תוצאה טובה בעברית.
# int8 מאפשר להריץ אותו גם על CPU בלי GPU.
model = WhisperModel("large-v3", device="cpu", compute_type="int8")

segments, info = model.transcribe(
    "episode-42.wav",
    language="he",              # אל תיתן לו לנחש - בעברית זה נכשל
    vad_filter=True,            # מדלג על שתיקות, מוריד זמן ריצה
    word_timestamps=True,       # נחוץ לחיתוך קליפים מדויק
    initial_prompt="פודקאסט על אוטומציה, n8n, בינה מלאכותית ו-LLM.",
)

for s in segments:
    print(f"[{s.start:7.2f} -> {s.end:7.2f}] {s.text}")

שתי השורות שעושות את ההבדל בעברית הן language="he" ו-initial_prompt. בלי הראשונה, Whisper לפעמים מזהה עברית כערבית או כפרסית ומחזיר ג'יבריש. השנייה היא טריק חשוב פחות מוכר: הטקסט שאתה נותן שם מטה את המודל לכיוון אוצר המילים שלך. אם הפודקאסט שלך מזכיר שוב ושוב "n8n", "LangChain" ו-"וקטור", כתוב אותם ב-initial_prompt — אחרת תקבל "אן-אייט-אן" ו"לאנג צ'יין".

מילון תיקונים

גם עם prompt טוב, שמות פרטיים ומונחים לועזיים בעברית ישתבשו. שווה להחזיק מילון קבוע ולהריץ אותו על כל תמלול:

REPLACEMENTS = {
    "אן איט אן": "n8n",
    "לאנג צ'יין": "LangChain",
    "אמבדינג": "embedding",
    "ראג": "RAG",
    "קלוד": "Claude",
}

def fix_terms(text: str) -> str:
    for wrong, right in REPLACEMENTS.items():
        text = text.replace(wrong, right)
    return text

זה נראה פרימיטיבי, והוא כן — אבל הוא חוסך את רוב זמן ההגהה, והוא צפוי לחלוטין, מה שלא נכון לגבי תיקון באמצעות מודל.

שלב 4: מי אמר מה — זיהוי דוברים

אם לא הקלטת בערוצים נפרדים, תצטרך diarization — חלוקת האודיו לדוברים. pyannote.audio הוא הסטנדרט הפתוח:

from pyannote.audio import Pipeline

pipeline = Pipeline.from_pretrained(
    "pyannote/speaker-diarization-3.1",
    use_auth_token=HF_TOKEN,     # דורש אישור לתנאי המודל ב-Hugging Face
)

diarization = pipeline("episode-42.wav", num_speakers=2)

for turn, _, speaker in diarization.itertracks(yield_label=True):
    print(f"{turn.start:6.1f}-{turn.end:6.1f}  {speaker}")

הפרמטר num_speakers משפר משמעותית את הדיוק כשאתה יודע כמה אנשים היו בחדר. אם אתה לא בטוח, אפשר להשתמש ב-min_speakers ו-max_speakers במקום.

שים לב שזו הסיבה שהמלצתי על ערוצים נפרדים בשלב ההקלטה: diarization על ערוץ אחד מגיע לדיוק סביר אבל לא מושלם, במיוחד כששני דוברים מדברים יחד. עם ערוצים נפרדים אין כאן בעיה בכלל — כל ערוץ הוא דובר.

שלב 5: עריכה מבוססת טקסט

זה השינוי התפיסתי הגדול בעריכת אודיו. במקום לגרור בגלי קול, אתה מוחק שורות מהתמלול והאודיו נחתך בהתאם. Descript הפך את זה לפופולרי, אבל את הפעולה הבסיסית — הסרת שתיקות — אפשר לעשות בשורה אחת עם ffmpeg:

# מסיר שתיקות ארוכות מ-0.6 שניות שיורדות מתחת ל-35dB-
ffmpeg -i episode-42.wav \
  -af "silenceremove=stop_periods=-1:stop_duration=0.6:stop_threshold=-35dB" \
  episode-42-tight.wav

ולנרמול עוצמה לתקן הפודקאסטים המקובל (‎-16 LUFS לסטריאו):

ffmpeg -i episode-42-tight.wav \
  -af "loudnorm=I=-16:TP=-1.5:LRA=11" \
  -ar 44100 episode-42-final.wav

loudnorm הוא ההבדל בין פרק שנשמע חובבני לפרק שנשמע מקצועי, והוא עולה שנייה אחת של עבודה. פלטפורמות ההאזנה מנרמלות עוצמה בעצמן, ופרק שמוגש חלש מדי יישמע שטוח אחרי הנרמול שלהן.

הסרת מילות מילוי

אפשר לחתוך "אה" ו"אמ" אוטומטית לפי חותמות הזמן ברמת המילה שקיבלנו מ-Whisper. אבל שווה להיזהר: מחקר על תפיסת דיבור מראה שהסרה מוחלטת של מילות מילוי גורמת לשיחה להישמע מלאכותית. הכלל המעשי הוא להסיר רק רצפים — "אה... אה... אה" — ולהשאיר מילות מילוי בודדות.

שלב 6: Show notes אוטומטיים

עם תמלול ביד, יצירת show notes היא קריאה אחת למודל. הטריק הוא לבקש פלט מובנה ולא טקסט חופשי, כדי שתוכל להזין אותו ישירות ל-RSS ולאתר:

import anthropic, json

client = anthropic.Anthropic()

PROMPT = """להלן תמלול מלא של פרק פודקאסט, עם חותמות זמן.

החזר JSON בלבד במבנה:
{
  "title": "כותרת בת 6-10 מילים, בלי מילים כמו 'מדהים'",
  "summary": "שני משפטים, מה המאזין ילמד",
  "chapters": [{"time": "MM:SS", "title": "..."}],
  "quotes": ["ציטוט מדויק מהתמלול", ...],
  "keywords": ["...", ...]
}

כללים:
- chapters: 5-9 פרקים, לפי מעברי נושא אמיתיים בלבד.
- quotes: 3 ציטוטים, מילה במילה מהתמלול. אל תמציא.
- אל תכתוב שום דבר מחוץ ל-JSON.

התמלול:
""" + transcript

msg = client.messages.create(
    model="claude-opus-5",
    max_tokens=2000,
    messages=[{"role": "user", "content": PROMPT}],
)
notes = json.loads(msg.content[0].text)

שתי ההוראות החשובות כאן הן "לפי מעברי נושא אמיתיים בלבד" ו"מילה במילה מהתמלול. אל תמציא". בלעדיהן המודל ייצר פרקים בחלוקה שווה מלאכותית, ויכתוב ציטוטים שנשמעים נכון אבל לא נאמרו — וזה מביך במיוחד כשמצטטים אורח.

אימות זול

אחרי שקיבלת את ה-JSON, בדוק בקוד שכל ציטוט מופיע מילולית בתמלול — if quote not in transcript. זו בדיקה של שתי שורות שתופסת את ההזיה היחידה שבאמת מסוכנת כאן.

שלב 7: מציאת הקליפים

הקליפים הקצרים הם מה שמביא מאזינים חדשים — הפרק המלא הוא מה ששומר אותם. מציאת הרגעים הנכונים היא בדיוק המשימה שבה מודל שפה חזק על תמלול.

CLIP_PROMPT = """מצא בתמלול 5 קטעים באורך 30-60 שניות
שעומדים בכל התנאים:
- מובנים לגמרי בלי הקשר ממה שקדם להם
- מכילים טענה, מספר או סיפור - לא הכללה
- מתחילים במשפט שגורם לרצות לשמוע את הבא אחריו

לכל קטע החזר: start, end, hook (המשפט הפותח), why.
דרג לפי סיכוי לעצור גלילה. JSON בלבד."""

ואז חיתוך בפועל לפי הזמנים שחזרו, בפורמט אנכי לרשתות:

ffmpeg -ss 00:14:22 -to 00:15:05 -i episode-42-final.wav \
  -c copy clip-01.wav

אם אתה מצלם וידאו, אותו חיתוך על קובץ הווידאו יחד עם כתוביות שנוצרות מהתמלול נותן קליף מוכן לפרסום. ראה וידאו עם AI להמשך התהליך.

שלב 8: לחבר הכול לצינור אחד

כל השלבים למעלה הם סקריפטים נפרדים, וזה בסדר לפרק אחד. מהפרק החמישי זה כבר מעיק. ב-n8n אפשר לחבר אותם לזרימה אחת שמופעלת ברגע שקובץ נכנס לתיקייה:

Webhook / Watch Folder   ← קובץ אודיו חדש נכנס
        ↓
Execute Command          ← ffmpeg: נרמול + הסרת שתיקות
        ↓
Execute Command          ← faster-whisper: תמלול + מילון תיקונים
        ↓
Anthropic node           ← show notes (JSON מובנה)
        ↓
Code node                ← אימות: כל ציטוט קיים בתמלול?
        ↓
Anthropic node           ← בחירת 5 קליפים
        ↓
Execute Command          ← ffmpeg: חיתוך הקליפים
        ↓
Google Drive + Slack     ← הכול לתיקייה + הודעה "מוכן לבדיקה"

שים לב לצומת האימות באמצע. אל תפרסם את הפלט אוטומטית. הזרימה צריכה להסתיים ב"מוכן לבדיקה", לא ב"פורסם" — התובנה הזאת עלתה לי בלמידה ממקרה בוחן אחר שבו זרימת פרסום אוטומטית לגמרי הוציאה תוכן שלא הייתי עומד מאחוריו.

כמה זה עולה

שלב כלי עלות לפרק שעה
תמלולfaster-whisper מקומי‎0 ₪ (‎~8 דק' CPU)
תמלולOpenAI Whisper API‎~1.3 ₪
זיהוי דובריםpyannote מקומי‎0 ₪
עריכה ונרמולffmpeg‎0 ₪
Show notes + קליפיםמודל שפה‎~2-4 ₪

כלומר צינור שרץ כמעט כולו מקומית עולה בין שקל לחמישה שקלים לפרק. השוואה מועילה: שירותי עריכת פודקאסט מסחריים מתחילים סביב 400 ₪ לפרק. ההבדל הוא שהם עושים גם שיפוט עריכתי, וזה בדיוק החלק שהצינור הזה לא עושה.

איזה מסלול לבחור — שלוש גישות

הצינור שתיארתי הוא הגישה המקומית, והיא לא מתאימה לכולם. שווה להיות ישיר לגבי מה שכל מסלול באמת נותן ומה הוא דורש בתמורה.

מסלול א': כלי הכול-באחד

Descript הוא הדוגמה המובהקת. אתה מעלה קובץ ומקבל תמלול, עריכה מבוססת טקסט, הסרת מילות מילוי בלחיצה, וייצוא קליפים — הכול בממשק אחד. העלות היא סביב 24 דולר לחודש, והתקרה היא שאתה עובד בתוך מה שהכלי מאפשר. אם הפודקאסט שלך בעברית, בדוק את איכות התמלול על פרק אמיתי לפני שאתה מתחייב למנוי שנתי — זה המקום שבו הכלים המסחריים נחלשים.

מסלול ב': פלטפורמת הקלטה עם AI מובנה

Riverside ו-Zencastr מקליטים מקומית בכל צד, מעלים אוטומטית, ומייצרים קליפים ותמלול. היתרון הגדול הוא שהם פותרים את בעיית איכות ההקלטה — שהיא, כזכור, הבעיה שקובעת את כל השאר. החיסרון הוא שהעיבוד שלהם הוא קופסה שחורה: אתה לא יכול להוסיף מילון תיקונים משלך.

מסלול ג': צינור מקומי

מה שתיארתי במדריך הזה. עולה כמעט כלום לפרק, נותן שליטה מלאה על התמלול והתיקונים, ורץ בלי תלות בשירות חיצוני. המחיר הוא הקמה ראשונית של כמה שעות, וזה שאתה מתחזק אותו. זו הבחירה הנכונה אם אתה מוציא פרקים בקביעות, אם העברית שלך מלאה במונחים מקצועיים, או אם אתה כבר מפעיל n8n ממילא.

המלצה מעשית: התחל במסלול ב' — הוא פותר את הבעיה החשובה ביותר, ההקלטה — והוסף אליו את חלק התמלול המקומי בלבד אם התמלול שלו לא מספיק טוב בעברית. אין סיבה לבנות את כל הצינור ביום הראשון.

מה מיוחד בפודקאסט בעברית

רוב מה שכתוב באינטרנט על AI לפודקאסטים נכתב עבור אנגלית, ושלושה דברים נשברים במעבר לעברית.

ראשית, שיעור השגיאה בתמלול גבוה יותר. Whisper אומן על הרבה פחות שעות עברית מאשר אנגלית, וזה מורגש בעיקר בשמות פרטיים, במונחים לועזיים ובמספרים. הפתרון הוא לא לוותר על התמלול האוטומטי אלא לבנות סביבו את שתי ההגנות שהוזכרו: initial_prompt עשיר במונחים שלך, ומילון תיקונים קבוע. יחד הם מורידים את ההגהה מ"לקרוא הכול" ל"לסרוק".

שנית, עברית ואנגלית מתערבבות בתוך משפט. "הרצתי את ה-workflow ב-n8n" הוא משפט תקין לגמרי בשיחה מקצועית בעברית, ומודלי תמלול מתקשים במעברי שפה בתוך משפט. כאן initial_prompt שכתוב באותו סגנון מעורב עוזר במידה ניכרת, כי הוא מראה למודל שזה הרישום הצפוי.

שלישית, כיווניות הטקסט. כשאתה מייצר כתוביות לקליפים, טקסט מעורב עברית-אנגלית מסודר לא נכון אם הכלי לא מטפל ב-RTL. בדוק קליף אחד לפני שאתה מייצר עשרים.

פרסום, RSS ו-SEO

הפודקאסט מתגלה בשני מקומות שונים לגמרי, ורוב היוצרים משקיעים רק באחד. הראשון הוא אפליקציות ההאזנה — Spotify, Apple Podcasts — שבהן הכותרת והתיאור הם כמעט כל מה שיש. השני הוא חיפוש רגיל, שאליו מגיעים דרך עמוד הפרק באתר שלך.

עמוד פרק שיש בו רק נגן הוא עמוד ריק מבחינת מנוע חיפוש. עמוד פרק עם התמלול המלא, חלוקה לפרקים וציטוטים הוא מסמך של אלפי מילים שאפשר למצוא בחיפוש. זו הסיבה הכי משכנעת להשקיע בתמלול, והיא לא קשורה לנגישות — אף שהיא כמובן משרתת גם אותה.

מה לכתוב בכותרת ובתיאור

אם התיאור וה-show notes נוצרים אוטומטית בשלב 6, כל זה כבר קורה — בתנאי שהפרומפט מבקש את זה במפורש. שווה להוסיף להוראות: "הכותרת לא תכיל את מספר הפרק. שלושת המשפטים הראשונים בתקציר יתארו מה המאזין ילמד."

מה למדוד

המספר שרוב היוצרים מסתכלים עליו — הורדות — הוא גם הכי פחות שימושי, כי הוא לא מבדיל בין מי ששמע דקה למי ששמע הכול. שלושה מספרים אומרים הרבה יותר:

מאיפה להתחיל

אם אתה מפיק פודקאסט היום ידנית, אל תבנה את כל הצינור בבת אחת — זו דרך בטוחה לא לסיים. הסדר שמחזיר הכי הרבה זמן בהכי מעט מאמץ:

  1. שבוע 1 — תמלול. הרץ faster-whisper על הפרק האחרון שלך. זה לבדו פותח את כל השאר.
  2. שבוע 2 — נרמול והסרת שתיקות. שתי פקודות ffmpeg. השיפור באיכות הנתפסת גדול ביחס למאמץ.
  3. שבוע 3 — show notes. קריאה אחת למודל עם הפרומפט המובנה, כולל בדיקת הציטוטים.
  4. שבוע 4 — קליפים. רק עכשיו, כשכל השאר עובד ואתה סומך על התמלול.
  5. אחר כך — לחבר ל-n8n. רק כשכל שלב עובד בנפרד ואתה יודע איך הוא נכשל.

הכלל שמנחה את הסדר הזה הוא שכל שלב כאן מסתמך על התמלול, ולכן שווה להשקיע קודם בכך שהתמלול יהיה טוב. צינור שבנוי על תמלול בינוני מייצר show notes בינוניים וקליפים שחתוכים במקום הלא נכון, ואז אתה מבלה יותר זמן בתיקון מאשר חסכת.

טעויות נפוצות

הצעד הבא

הפוך פרק אחד להרבה תוכן, או הוסף קול AI לאינטרו ולאאוטרו.