על כל מילה אחת שפרק פודקאסט ישראלי מפרסם כטקסט, נאמרו בו 73 מילים שלא נכתבו מעולם. זה החציון על 3,783 פרקים שתומללו וחוברו לשורת הפיד שלהם. במילים אחרות, 1.36 אחוז ממה שנאמר בפרק הפך לטקסט שמנוע חיפוש או מנוע תשובות יכול לקרוא.
כל המספרים כאן חושבו מחדש מהקורפוס בזמן הכתיבה, בסקריפט אחד שרץ משורש הריפו: scripts/mag_israeli-podcast-descriptions-vs-speech.py. הוא מדפיס כל מספר שמופיע בכתבה יחד עם ה-N שלו. שיטת החישוב וההגבלות שלה מפורטות בעמוד המתודולוגיה, ונתוני השוק המלאים בעמוד הסטטיסטיקות.
מה בעצם מתפרסם יחד עם פרק
בדקנו 39,114 שורות פרק מוטמעות ב-3,367 תוכניות ישראליות, אחרי שהסרנו 1,058 שורות כפולות (אותו guid פעמיים בתוך אותה תוכנית). התיאור המפורסם, אחרי ניקוי תגיות HTML, מגיע לחציון של 384 תווים. זה כשמונה שורות טקסט.
הצד המעניין הוא לא החציון אלא הקצה הדל, ושם המספרים חדים: 10,462 שורות פרק, 26.7 אחוז, מתפרסמות עם פחות מ-200 תווים. 5,925 מהן, 15.1 אחוז, מתחת ל-100 תווים. ו-1,287 שורות פרק, 3.3 אחוז, מתפרסמות בלי תיאור בכלל, שדה ריק לגמרי. רבע מהאינדקס הישראלי משגר פרק לעולם עם פחות טקסט ממה שיש בפסקה הזאת.

התקרה שחייבים להצהיר עליה
יש כאן מגבלת מדידה אמיתית ואנחנו מצהירים עליה מראש. הקוצר שלנו, scripts/harvest.py בשורה 265, שומר את התיאור חתוך ל-600 תווים. המשמעות: כל מספר אורך בכתבה הזאת הוא רצפה, לא מדידה מלאה, ואי אפשר לומר שום דבר על הזנב הארוך של התיאורים הארוכים.
כמה גדולה התקרה הזאת? מדדנו אותה ישירות: 8,578 שורות פרק, 21.9 אחוז מהאינדקס, יושבות בדיוק על 600 תווים. זאת בדיוק הכמות שנחתכה. מכיוון שכל החיתוך הזה נמצא מעל החציון, החציון עצמו מדויק גם תחת התקרה, בעוד שהממוצע הוא רצפה. וכל הסטטיסטיקות של הצד הקצר, אלה שהכתבה מובילה איתן, לא מושפעות מהתקרה כלל: תיאור של 40 תווים נשאר באורך 40 תווים.
התפלגות אורך התיאור המפורסם, וקיר התקרה
N = 39,114 שורות פרק, 3,367 תוכניות. העמודה הצהובה היא הקיר: שורות שנחתכו בדיוק בתקרת 600 התווים של הקוצר, ולכן אורכן האמיתי אינו ידוע.
ציר המדרגות: אורך התיאור בתווים אחרי ניקוי HTML, מ-0 תווים בימין ועד תקרת החיתוך בשמאל.
המדרגה הגדולה ביותר היא הקיר עצמו: 8,578 שורות פרק, 21.9 אחוז. אחריה 500-599 תווים עם 6,284 שורות.
מקור (corpus_query): scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json, כל שורות הפרק המוטמעות ללא כפילויות guid, סעיף 2b. כל עמודה נושאת את מספרה גם בלי JavaScript.
מה קרה כשחיברנו כל תמלול לפרק שלו
שתי חציונים לא מחוברים אינם ממצא. לכן חיברנו כל תמלול לשורת הפרק שלו דרך ה-guid שבקובץ הלוואי של התמלול, ולא דרך מספר הפרק בשם הקובץ, שידוע כנודד. מתוך 5,483 קבצי לוואי, 4,989 פרקים נמצאו כשורה חיה בפיד של התוכנית שלהם. 470 לא נמצאו כי הפרק כבר גלגל מהפיד, ו-24 בלי קובץ תמלול.
מתוך המחוברים לקחנו רק את מי שהתיאור שלו מתחת לתקרה, כלומר נמדד במדויק, ולא ריק: 3,783 פרקים. עליהם:
| מדד | חציון |
|---|---|
| מילים שנאמרו בפרק | 3,489 |
| מילים שפורסמו בתיאור | 57 |
| תווים שפורסמו בתיאור | 351 |
| יחס נאמר מול פורסם | 73.3 : 1 |
| אחוז המילים שהפך לטקסט | 1.36% |
הפיזור סביב החציון צר יותר ממה שמצפים: הרבעון התחתון עומד על 39 : 1 והעליון על 137 : 1, ו-95.6 אחוז מהפרקים המחוברים נמצאים ביחס של 20 : 1 או גרוע ממנו. זה לא ממצא של קצה. זה מצב הברירה מחדל.
שני סייגים, שניהם מושכים את המספר כלפי מטה ולא כלפי מעלה. ראשית, קבוצת המחוברים מוטה לפרקים ארוכים: החציון בה הוא 3,489 מילים מדוברות, לעומת 2,491 בכל 10,946 התמלולים הקנוניים. שנית, חלק מהתמלולים הישנים סובלים מפגם קטיעה ידוע שמקבע אותם סביב 2,350 מילים, כך שספירת המילים המדוברות היא בעצמה רצפה. מי שמעדיף את הגרסה השמרנית ביותר יכול לקחת את שתי ההתפלגויות בנפרד, בלי חיבור: חציון של 2,491 מילים מדוברות (N=10,946) מול חציון של 48 מילים מפורסמות בכל השורות מתחת לתקרה (N=30,536). גם אז היחס הוא 52 : 1.

הפער לפי קטגוריה, ומה הוא מגלה
הפער אינו אחיד. יהדות ודת היא הקטגוריה הדלה ביותר בטקסט: 49.3 אחוז משורות הפרק בה מתפרסמות עם פחות מ-200 תווים, ו-13.7 אחוז בלי תיאור בכלל (N=4,789 שורות פרק). בקצה השני נמצאת הורות ומשפחה עם 7.2 אחוז בלבד מתחת ל-200 תווים ואפס פרקים בלי תיאור (N=753), ומיד אחריה כלכלה ועסקים והייטק וסטארטאפים, שתיהן על 11.2 אחוז.
ההסבר פשוט וכלכלי. תוכניות עסקים והייטק נכתבות על ידי מי שכבר מוכר משהו, ולכן שדה התיאור מטופל כמו דף נחיתה. שיעור תורה יומי מתפרסם על ידי מי שהאודיו הוא כל המוצר. הבעיה היא שדווקא בקטגוריה הדלה ביותר מדובר גם הרבה: החציון ביהדות ודת הוא 3,795 מילים מדוברות לפרק (N=405 תמלולים), ויחס של 73.5 : 1 (N=321).
הפער הקיצוני ביותר שנמדד הוא בקומדיה והומור, 205.6 : 1 (N=117 פרקים מחוברים), עם חציון של 8,319 מילים מדוברות לפרק. אחריה פשעים אמיתיים עם 158.0 : 1 (N=59) וכדורגל עם 132.0 : 1 (N=86). אלה בדיוק הפורמטים שבהם מדברים הכי הרבה וכותבים הכי מעט.
בדקו קטגוריה: כמה טקסט היא מפרסמת, וכמה נאמר בה
בכל האינדקס, 26.7% משורות הפרק מתפרסמות עם פחות מ-200 תווים ו-3.3% בלי תיאור בכלל (N=39,114 שורות פרק). בפרקים שתומללו, החציון הוא 2,491 מילים מדוברות (N=10,946 תמלולים), והיחס החציוני בין מה שנאמר למה שפורסם הוא 73.3 : 1 (N=3,783 פרקים מחוברים).
| קטגוריה | שורות פרק (N) | פחות מ-200 תווים | בלי תיאור | תמלולים (N) | חציון מילים מדוברות | יחס חציוני |
|---|---|---|---|---|---|---|
| תרבות וספרות | 8,881 | 32.8% | 3.3% | 1,033 | 3,904 | 77.5 : 1 |
| כלכלה ועסקים | 5,399 | 11.2% | 0.6% | 770 | 2,656 | 43.3 : 1 |
| יהדות ודת | 4,789 | 49.3% | 13.7% | 405 | 3,795 | 73.5 : 1 |
| פסיכולוגיה | 3,402 | 13.7% | 0.7% | 439 | 3,239 | 61.6 : 1 |
| חדשות ואקטואליה | 2,402 | 27.6% | 2.1% | 539 | 6,603 | 117.8 : 1 |
| בריאות ואיכות חיים | 1,594 | 18.6% | 0.4% | 180 | 3,549 | 58.3 : 1 |
| ללא סיווג | 1,566 | 22.6% | 2.6% | 146 | 4,138 | 80.6 : 1 |
| קומדיה והומור | 1,548 | 30.3% | 1.0% | 151 | 8,319 | 205.6 : 1 |
| ספורט | 1,391 | 35.0% | 0.5% | 123 | 2,796 | 79.3 : 1 |
| הייטק וסטארטאפים | 1,308 | 11.2% | 0.1% | 211 | 4,436 | 57.2 : 1 |
| ילדים ומשפחה | 1,138 | 34.6% | 8.0% | 172 | 2,115 | 35.8 : 1 |
| בידור | 1,029 | 30.2% | 0.7% | 80 | 2,820 | 119.8 : 1 |
| כדורגל | 998 | 31.6% | 3.4% | 149 | 7,432 | 132.0 : 1 |
| היסטוריה | 980 | 19.5% | 1.6% | 116 | 3,439 | 60.6 : 1 |
| טלוויזיה וקולנוע | 806 | 24.2% | 0.0% | 90 | 2,660 | 65.3 : 1 |
| הורות ומשפחה | 753 | 7.2% | 0.0% | 79 | 2,817 | 78.9 : 1 |
| מדע | 652 | 13.7% | 0.5% | 203 | 5,611 | 76.2 : 1 |
| ראיונות ואנשים | 291 | 32.3% | 0.0% | 37 | 2,352 | לא מספיק נתונים (N=26) |
| פשעים אמיתיים | 187 | 30.5% | 2.7% | 66 | 6,269 | 158.0 : 1 |
מקור (corpus_query): scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json מחובר ל-data/transcripts דרך guid. קטגוריות מתחת ל-30 שורות הושמטו, ויחס חציוני מוצג רק מ-30 פרקים מחוברים ומעלה.

איך זה נראה בפרק אחד
שלושה פרקים אמיתיים מהאינדקס, כל אחד עם קישור לעמוד הפרק שלו. הציטוטים הועתקו מילה במילה מקובץ התמלול, והמיקום של כל פרק אומת מול ה-guid שלו בפיד החי.
1. פרק בלי תיאור בכלל. סיכום משחקי השבת, פרק 217 של קיקטוק מפרסם שדה תיאור ריק לחלוטין. התמלול שלו מכיל 16,509 מילים. הפרק פותח בקריאת חסות מסחרית ואז ניגש לעניין: בוא נתחיל, יש חמישה משחקים לדבר עליהם.
גם קריאת החסות עצמה, שמישהו שילם עליה, לא קיימת כטקסט בשום מקום: כל מה שאתם צריכים כדי להתמקד אך ורק בצמיחה של העסק שלכם.
בקורפוס שלנו יש 94 פרקים מחוברים שמפרסמים שדה תיאור ריק ומכילים 4,000 מילים מדוברות ומעלה. עוד מהתחום בעמוד הנושא כדורגל.
2. פרק שהתיאור שלו הוא הכותרת שלו. הפורום המושלם ולשם מדברים על המונדיאל, בתוכנית ציון 3 מפרסם תיאור של 37 תווים, שהוא בדיוק הכותרת מועתקת. התמלול מכיל 18,073 מילים, והוא כולל הרבה מעבר למונדיאל. באחת השורות נאמר: אני לא יכול לנרמל את זה שכל בוקר אני קם ובנים בגיל 21 נופלים.
התיאור המפורסם אינו מרמז שהשיחה הזאת קיימת בפרק. עוד בנושא בעמוד מלחמה וביטחון.
3. פרק שהפלטפורמה מילאה עבורו את התיאור. הפרק עם אמירם טובים, פרק 356 של המוג׳ו של בן בן ברוך מפרסם תיאור של 32 תווים שנוצר אוטומטית מהכותרת ומשם המנחה. התמלול מכיל 22,459 מילים, שיחה שנפתחת כך: מתי בפעם האחרונה חיכיתם למשהו שלוש שנים?
יחס של יותר מ-2,800 מילים מדוברות על כל מילה מפורסמת, בפרק אחד. עמוד היוצר: בן בן ברוך.
המנגנון: למה זה קורה בכלל
אף אחד מהמנחים האלה לא התרשל. המנגנון פשוט לא מבקש מהם טקסט. תקן ה-RSS של פודקאסטים נבנה כדי להעביר קובץ אודיו, לא כדי להעביר תוכן. הזחלן מקבל כותרת, תאריך, תיאור קצר וקישור לקובץ בינארי, ועוצר שם.
המנגנון: מה בדיוק מגיע לזחלן, שלב אחר שלב
לחצו על שלב כדי לפתוח אותו, או השתמשו בחיצים. בלי JavaScript כל חמשת השלבים פתוחים ממילא.
title, description, pubDate ו-enclosure. התיאור החציוני באינדקס הוא 384 תווים (N=39,114), וב-26.7 אחוז מהשורות פחות מ-200.enclosure הוא קובץ אודיו בינארי, ואף אחד מהם לא מתמלל אותו בשבילכם. מה שנכנס לאינדקס הוא בדיוק מה שהיה בשדה התיאור, ולא מילה מעבר.מקור: scripts/mag_israeli-podcast-descriptions-vs-speech.py, סעיפים 2 ו-4.
שימו לב לנקודה שקל לפספס: אין כאן בעיית דירוג אלא בעיית קיום. עמוד לא מדורג נמוך על תוכן שאין לו. ההסבר שנאמר בפרק פשוט לא נמצא באינדקס של אף מנוע, ולכן אי אפשר לצטט אותו, לקשר אליו או להגיע אליו דרך חיפוש.
מה זה אומר ליוצרים
המסקנה המעשית היא לא לכתוב תיאורים ארוכים יותר. תיאור בן 600 תווים עדיין מכסה פחות מחמישה אחוזים מפרק טיפוסי, ואף אחד לא הולך לתמלל 300 פרקים בידיים. הפער בין 3,489 מילים מדוברות ל-57 מילים מפורסמות אינו פער של מאמץ, הוא פער של תהליך.
זה בדיוק מה שהאתר הזה עושה על הקורפוס כולו: 42,350,016 מילים מדוברות מ-10,946 פרקים כבר קיימות אצלנו כטקסט, ומהן נבנים עמודי הפרקים, עמודי הנושאים ורשימות המומלצים לפי קטגוריה. אותו תהליך, מופעל על ארכיון של תוכנית אחת, הופך אותו ממאגר אודיו למגזין עברי שאפשר למצוא ולצטט. ההסבר המלא נמצא בעמוד ליוצרים.
שאלות ותשובות
כמה טקסט מפרסם פרק פודקאסט ישראלי ממוצע? החציון הוא 384 תווים, כשמונה שורות (N=39,114 שורות פרק). זה מספר רצפה, כי הקוצר שלנו חותך את השדה ב-600 תווים.
כמה פרקים מתפרסמים בלי תיאור בכלל? 1,287 שורות פרק, 3.3 אחוז מהאינדקס. המספר הזה מדויק ואינו מושפע מהחיתוך.
מה היחס בין מה שנאמר בפרק למה שפורסם עליו? 73.3 מילים מדוברות על כל מילה מפורסמת, בחציון, על 3,783 פרקים שחוברו לשורת הפיד שלהם. הרבעונים הם 39 : 1 ו-137 : 1.
איזו קטגוריה הכי דלה בטקסט? יהדות ודת, עם 49.3 אחוז משורות הפרק מתחת ל-200 תווים ו-13.7 אחוז בלי תיאור (N=4,789). הכי מטופחת היא הורות ומשפחה עם 7.2 אחוז בלבד (N=753).
למה גוגל או ChatGPT לא פשוט מתמללים את הפרק? כי הזחלן מקבל קישור לקובץ אודיו בינארי ולא טקסט. מנוע תשובות מצטט רק מה שקרא, ולכן תוכן שקיים רק כאודיו אינו קיים מבחינתו.
האם המספרים כאן ניתנים לשחזור? כן. הריצו python3 scripts/mag_israeli-podcast-descriptions-vs-speech.py משורש הריפו. הוא רץ בפחות מדקה ומדפיס כל מספר בכתבה יחד עם ה-N שלו.
הארכיון שלכם הוא אודיו מת שגוגל ו-ChatGPT לא מוצאים
כל פרק יכול להיות מאמר עברי שמדורג בגוגל ומצוטט על ידי מנועי הבינה המלאכותית. זה בדיוק מה שעשינו כאן, אוטומטית, על הקורפוס כולו.
הכתבה נכתבה בסיוע בינה מלאכותית על בסיס ניתוח הקורפוס של פודקאסט·ישראל. שיטת החישוב: scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json (כל שורות הפרק המוטמעות, ללא כפילויות guid בתוך תוכנית) מחובר ל-data/transcripts/*__ep<N>.txt דרך ה-guid שבקובץ הלוואי; אורך התיאור נמדד בתווים ובמילים, אורך הדיבור נמדד במילים בקובץ התמלול, והיחס הראשי הוא החציון על תת-הקבוצה שהתיאור שלה מתחת לתקרת 600 התווים ואינו ריק. המספרים ניתנים לשחזור דרך עמוד המתודולוגיה.


