73 מילים נאמרו על כל מילה שפורסמה: מה באמת נשאר מפרק פודקאסט ישראלי

    0
    13

    על כל מילה אחת שפרק פודקאסט ישראלי מפרסם כטקסט, נאמרו בו 73 מילים שלא נכתבו מעולם. זה החציון על 3,783 פרקים שתומללו וחוברו לשורת הפיד שלהם. במילים אחרות, 1.36 אחוז ממה שנאמר בפרק הפך לטקסט שמנוע חיפוש או מנוע תשובות יכול לקרוא.

    כל המספרים כאן חושבו מחדש מהקורפוס בזמן הכתיבה, בסקריפט אחד שרץ משורש הריפו: scripts/mag_israeli-podcast-descriptions-vs-speech.py. הוא מדפיס כל מספר שמופיע בכתבה יחד עם ה-N שלו. שיטת החישוב וההגבלות שלה מפורטות בעמוד המתודולוגיה, ונתוני השוק המלאים בעמוד הסטטיסטיקות.

    מה בעצם מתפרסם יחד עם פרק

    בדקנו 39,114 שורות פרק מוטמעות ב-3,367 תוכניות ישראליות, אחרי שהסרנו 1,058 שורות כפולות (אותו guid פעמיים בתוך אותה תוכנית). התיאור המפורסם, אחרי ניקוי תגיות HTML, מגיע לחציון של 384 תווים. זה כשמונה שורות טקסט.

    הצד המעניין הוא לא החציון אלא הקצה הדל, ושם המספרים חדים: 10,462 שורות פרק, 26.7 אחוז, מתפרסמות עם פחות מ-200 תווים. 5,925 מהן, 15.1 אחוז, מתחת ל-100 תווים. ו-1,287 שורות פרק, 3.3 אחוז, מתפרסמות בלי תיאור בכלל, שדה ריק לגמרי. רבע מהאינדקס הישראלי משגר פרק לעולם עם פחות טקסט ממה שיש בפסקה הזאת.

    תרשים נתונים המראה כי 26.7 אחוז מהפרקים הישראליים מתפרסמים עם תיאור קצר מ-200 תווים, 10,462 מתוך 39,114 שורות פרק.
    איור 1: 26.7 אחוז מהפרקים מתפרסמים עם פחות מ-200 תווים, ועוד 3.3 אחוז בלי תיאור בכלל. N=39,114 שורות פרק.

    התקרה שחייבים להצהיר עליה

    יש כאן מגבלת מדידה אמיתית ואנחנו מצהירים עליה מראש. הקוצר שלנו, scripts/harvest.py בשורה 265, שומר את התיאור חתוך ל-600 תווים. המשמעות: כל מספר אורך בכתבה הזאת הוא רצפה, לא מדידה מלאה, ואי אפשר לומר שום דבר על הזנב הארוך של התיאורים הארוכים.

    כמה גדולה התקרה הזאת? מדדנו אותה ישירות: 8,578 שורות פרק, 21.9 אחוז מהאינדקס, יושבות בדיוק על 600 תווים. זאת בדיוק הכמות שנחתכה. מכיוון שכל החיתוך הזה נמצא מעל החציון, החציון עצמו מדויק גם תחת התקרה, בעוד שהממוצע הוא רצפה. וכל הסטטיסטיקות של הצד הקצר, אלה שהכתבה מובילה איתן, לא מושפעות מהתקרה כלל: תיאור של 40 תווים נשאר באורך 40 תווים.

    התפלגות אורך התיאור המפורסם, וקיר התקרה

    N = 39,114 שורות פרק, 3,367 תוכניות. העמודה הצהובה היא הקיר: שורות שנחתכו בדיוק בתקרת 600 התווים של הקוצר, ולכן אורכן האמיתי אינו ידוע.

    קיר תקרת 600 התווים0 תווים: 1,287 שורות פרק, 3.3 אחוז1,28701-99 תווים: 4,638 שורות פרק, 11.9 אחוז4,6381-99100-199 תווים: 4,537 שורות פרק, 11.6 אחוז4,537100-199200-299 תווים: 5,150 שורות פרק, 13.2 אחוז5,150200-299300-399 תווים: 4,710 שורות פרק, 12.0 אחוז4,710300-399400-499 תווים: 3,930 שורות פרק, 10.0 אחוז3,930400-499500-599 תווים: 6,284 שורות פרק, 16.1 אחוז6,284500-599600 תווים: 8,578 שורות פרק, 21.9 אחוז8,578600

    ציר המדרגות: אורך התיאור בתווים אחרי ניקוי HTML, מ-0 תווים בימין ועד תקרת החיתוך בשמאל.

    המדרגה הגדולה ביותר היא הקיר עצמו: 8,578 שורות פרק, 21.9 אחוז. אחריה 500-599 תווים עם 6,284 שורות.

    מקור (corpus_query): scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json, כל שורות הפרק המוטמעות ללא כפילויות guid, סעיף 2b. כל עמודה נושאת את מספרה גם בלי JavaScript.

    מה קרה כשחיברנו כל תמלול לפרק שלו

    שתי חציונים לא מחוברים אינם ממצא. לכן חיברנו כל תמלול לשורת הפרק שלו דרך ה-guid שבקובץ הלוואי של התמלול, ולא דרך מספר הפרק בשם הקובץ, שידוע כנודד. מתוך 5,483 קבצי לוואי, 4,989 פרקים נמצאו כשורה חיה בפיד של התוכנית שלהם. 470 לא נמצאו כי הפרק כבר גלגל מהפיד, ו-24 בלי קובץ תמלול.

    מתוך המחוברים לקחנו רק את מי שהתיאור שלו מתחת לתקרה, כלומר נמדד במדויק, ולא ריק: 3,783 פרקים. עליהם:

    מדד חציון
    מילים שנאמרו בפרק 3,489
    מילים שפורסמו בתיאור 57
    תווים שפורסמו בתיאור 351
    יחס נאמר מול פורסם 73.3 : 1
    אחוז המילים שהפך לטקסט 1.36%

    הפיזור סביב החציון צר יותר ממה שמצפים: הרבעון התחתון עומד על 39 : 1 והעליון על 137 : 1, ו-95.6 אחוז מהפרקים המחוברים נמצאים ביחס של 20 : 1 או גרוע ממנו. זה לא ממצא של קצה. זה מצב הברירה מחדל.

    שני סייגים, שניהם מושכים את המספר כלפי מטה ולא כלפי מעלה. ראשית, קבוצת המחוברים מוטה לפרקים ארוכים: החציון בה הוא 3,489 מילים מדוברות, לעומת 2,491 בכל 10,946 התמלולים הקנוניים. שנית, חלק מהתמלולים הישנים סובלים מפגם קטיעה ידוע שמקבע אותם סביב 2,350 מילים, כך שספירת המילים המדוברות היא בעצמה רצפה. מי שמעדיף את הגרסה השמרנית ביותר יכול לקחת את שתי ההתפלגויות בנפרד, בלי חיבור: חציון של 2,491 מילים מדוברות (N=10,946) מול חציון של 48 מילים מפורסמות בכל השורות מתחת לתקרה (N=30,536). גם אז היחס הוא 52 : 1.

    תרשים נתונים המראה כי 98.6 אחוז ממה שנאמר בפרק פודקאסט ישראלי לא הפך מעולם לטקסט שאפשר לקרוא.
    איור 2: 98.6 אחוז מהמילים שנאמרו בפרק לא קיבלו קיום כטקסט. חציון על 3,783 פרקים מחוברים.

    הפער לפי קטגוריה, ומה הוא מגלה

    הפער אינו אחיד. יהדות ודת היא הקטגוריה הדלה ביותר בטקסט: 49.3 אחוז משורות הפרק בה מתפרסמות עם פחות מ-200 תווים, ו-13.7 אחוז בלי תיאור בכלל (N=4,789 שורות פרק). בקצה השני נמצאת הורות ומשפחה עם 7.2 אחוז בלבד מתחת ל-200 תווים ואפס פרקים בלי תיאור (N=753), ומיד אחריה כלכלה ועסקים והייטק וסטארטאפים, שתיהן על 11.2 אחוז.

    ההסבר פשוט וכלכלי. תוכניות עסקים והייטק נכתבות על ידי מי שכבר מוכר משהו, ולכן שדה התיאור מטופל כמו דף נחיתה. שיעור תורה יומי מתפרסם על ידי מי שהאודיו הוא כל המוצר. הבעיה היא שדווקא בקטגוריה הדלה ביותר מדובר גם הרבה: החציון ביהדות ודת הוא 3,795 מילים מדוברות לפרק (N=405 תמלולים), ויחס של 73.5 : 1 (N=321).

    הפער הקיצוני ביותר שנמדד הוא בקומדיה והומור, 205.6 : 1 (N=117 פרקים מחוברים), עם חציון של 8,319 מילים מדוברות לפרק. אחריה פשעים אמיתיים עם 158.0 : 1 (N=59) וכדורגל עם 132.0 : 1 (N=86). אלה בדיוק הפורמטים שבהם מדברים הכי הרבה וכותבים הכי מעט.

    בדקו קטגוריה: כמה טקסט היא מפרסמת, וכמה נאמר בה

    בכל האינדקס, 26.7% משורות הפרק מתפרסמות עם פחות מ-200 תווים ו-3.3% בלי תיאור בכלל (N=39,114 שורות פרק). בפרקים שתומללו, החציון הוא 2,491 מילים מדוברות (N=10,946 תמלולים), והיחס החציוני בין מה שנאמר למה שפורסם הוא 73.3 : 1 (N=3,783 פרקים מחוברים).

    כל 19 הקטגוריות שעברו את סף 30 השורות. הטבלה נכונה גם בלי JavaScript.
    קטגוריה שורות פרק (N) פחות מ-200 תווים בלי תיאור תמלולים (N) חציון מילים מדוברות יחס חציוני
    תרבות וספרות 8,881 32.8% 3.3% 1,033 3,904 77.5 : 1
    כלכלה ועסקים 5,399 11.2% 0.6% 770 2,656 43.3 : 1
    יהדות ודת 4,789 49.3% 13.7% 405 3,795 73.5 : 1
    פסיכולוגיה 3,402 13.7% 0.7% 439 3,239 61.6 : 1
    חדשות ואקטואליה 2,402 27.6% 2.1% 539 6,603 117.8 : 1
    בריאות ואיכות חיים 1,594 18.6% 0.4% 180 3,549 58.3 : 1
    ללא סיווג 1,566 22.6% 2.6% 146 4,138 80.6 : 1
    קומדיה והומור 1,548 30.3% 1.0% 151 8,319 205.6 : 1
    ספורט 1,391 35.0% 0.5% 123 2,796 79.3 : 1
    הייטק וסטארטאפים 1,308 11.2% 0.1% 211 4,436 57.2 : 1
    ילדים ומשפחה 1,138 34.6% 8.0% 172 2,115 35.8 : 1
    בידור 1,029 30.2% 0.7% 80 2,820 119.8 : 1
    כדורגל 998 31.6% 3.4% 149 7,432 132.0 : 1
    היסטוריה 980 19.5% 1.6% 116 3,439 60.6 : 1
    טלוויזיה וקולנוע 806 24.2% 0.0% 90 2,660 65.3 : 1
    הורות ומשפחה 753 7.2% 0.0% 79 2,817 78.9 : 1
    מדע 652 13.7% 0.5% 203 5,611 76.2 : 1
    ראיונות ואנשים 291 32.3% 0.0% 37 2,352 לא מספיק נתונים (N=26)
    פשעים אמיתיים 187 30.5% 2.7% 66 6,269 158.0 : 1

    מקור (corpus_query): scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json מחובר ל-data/transcripts דרך guid. קטגוריות מתחת ל-30 שורות הושמטו, ויחס חציוני מוצג רק מ-30 פרקים מחוברים ומעלה.

    תרשים נתונים המראה כי יהדות ודת היא הקטגוריה עם שיעור התיאורים הדלים הגבוה ביותר, 49.3 אחוז מתחת ל-200 תווים.
    איור 3: יהדות ודת מובילה בעוני התיאורים עם 49.3 אחוז מתחת ל-200 תווים. N=4,789 שורות פרק בקטגוריה.

    איך זה נראה בפרק אחד

    שלושה פרקים אמיתיים מהאינדקס, כל אחד עם קישור לעמוד הפרק שלו. הציטוטים הועתקו מילה במילה מקובץ התמלול, והמיקום של כל פרק אומת מול ה-guid שלו בפיד החי.

    1. פרק בלי תיאור בכלל. סיכום משחקי השבת, פרק 217 של קיקטוק מפרסם שדה תיאור ריק לחלוטין. התמלול שלו מכיל 16,509 מילים. הפרק פותח בקריאת חסות מסחרית ואז ניגש לעניין: בוא נתחיל, יש חמישה משחקים לדבר עליהם. גם קריאת החסות עצמה, שמישהו שילם עליה, לא קיימת כטקסט בשום מקום: כל מה שאתם צריכים כדי להתמקד אך ורק בצמיחה של העסק שלכם. בקורפוס שלנו יש 94 פרקים מחוברים שמפרסמים שדה תיאור ריק ומכילים 4,000 מילים מדוברות ומעלה. עוד מהתחום בעמוד הנושא כדורגל.

    2. פרק שהתיאור שלו הוא הכותרת שלו. הפורום המושלם ולשם מדברים על המונדיאל, בתוכנית ציון 3 מפרסם תיאור של 37 תווים, שהוא בדיוק הכותרת מועתקת. התמלול מכיל 18,073 מילים, והוא כולל הרבה מעבר למונדיאל. באחת השורות נאמר: אני לא יכול לנרמל את זה שכל בוקר אני קם ובנים בגיל 21 נופלים. התיאור המפורסם אינו מרמז שהשיחה הזאת קיימת בפרק. עוד בנושא בעמוד מלחמה וביטחון.

    3. פרק שהפלטפורמה מילאה עבורו את התיאור. הפרק עם אמירם טובים, פרק 356 של המוג׳ו של בן בן ברוך מפרסם תיאור של 32 תווים שנוצר אוטומטית מהכותרת ומשם המנחה. התמלול מכיל 22,459 מילים, שיחה שנפתחת כך: מתי בפעם האחרונה חיכיתם למשהו שלוש שנים? יחס של יותר מ-2,800 מילים מדוברות על כל מילה מפורסמת, בפרק אחד. עמוד היוצר: בן בן ברוך.

    המנגנון: למה זה קורה בכלל

    אף אחד מהמנחים האלה לא התרשל. המנגנון פשוט לא מבקש מהם טקסט. תקן ה-RSS של פודקאסטים נבנה כדי להעביר קובץ אודיו, לא כדי להעביר תוכן. הזחלן מקבל כותרת, תאריך, תיאור קצר וקישור לקובץ בינארי, ועוצר שם.

    המנגנון: מה בדיוק מגיע לזחלן, שלב אחר שלב

    לחצו על שלב כדי לפתוח אותו, או השתמשו בחיצים. בלי JavaScript כל חמשת השלבים פתוחים ממילא.

    1. המנחה מקליטפרק ישראלי טיפוסי שתומלל אצלנו מכיל 3,489 מילים מדוברות בחציון (N=3,783 פרקים מחוברים). זה כל התוכן שקיים ברגע הזה, והוא קיים רק כאודיו.
    2. הפלטפורמה בונה שורת RSSהשורה נושאת ארבעה שדות בלבד שמעניינים מנוע חיפוש: title, description, pubDate ו-enclosure. התיאור החציוני באינדקס הוא 384 תווים (N=39,114), וב-26.7 אחוז מהשורות פחות מ-200.
    3. הזחלן מוריד את השורהגוגל, ChatGPT ו-Perplexity קוראים טקסט. ה-enclosure הוא קובץ אודיו בינארי, ואף אחד מהם לא מתמלל אותו בשבילכם. מה שנכנס לאינדקס הוא בדיוק מה שהיה בשדה התיאור, ולא מילה מעבר.
    4. מנוע התשובות מצטטמנוע שמצטט מקורות יכול לצטט רק את מה שקרא. אם הפרק הסביר משהו בפירוט במשך 40 דקות והתיאור הוא שורת כותרת, המנוע לא יודע שההסבר קיים ולא יפנה אליו.
    5. התוצאה במספר אחדהיחס החציוני בין מה שנאמר למה שפורסם הוא 73.3 : 1 (N=3,783). כלומר 1.36 אחוז מהמילים שנאמרו קיבלו קיום כטקסט, ו-98.6 אחוז לא.

    מקור: scripts/mag_israeli-podcast-descriptions-vs-speech.py, סעיפים 2 ו-4.

    שימו לב לנקודה שקל לפספס: אין כאן בעיית דירוג אלא בעיית קיום. עמוד לא מדורג נמוך על תוכן שאין לו. ההסבר שנאמר בפרק פשוט לא נמצא באינדקס של אף מנוע, ולכן אי אפשר לצטט אותו, לקשר אליו או להגיע אליו דרך חיפוש.

    מה זה אומר ליוצרים

    המסקנה המעשית היא לא לכתוב תיאורים ארוכים יותר. תיאור בן 600 תווים עדיין מכסה פחות מחמישה אחוזים מפרק טיפוסי, ואף אחד לא הולך לתמלל 300 פרקים בידיים. הפער בין 3,489 מילים מדוברות ל-57 מילים מפורסמות אינו פער של מאמץ, הוא פער של תהליך.

    זה בדיוק מה שהאתר הזה עושה על הקורפוס כולו: 42,350,016 מילים מדוברות מ-10,946 פרקים כבר קיימות אצלנו כטקסט, ומהן נבנים עמודי הפרקים, עמודי הנושאים ורשימות המומלצים לפי קטגוריה. אותו תהליך, מופעל על ארכיון של תוכנית אחת, הופך אותו ממאגר אודיו למגזין עברי שאפשר למצוא ולצטט. ההסבר המלא נמצא בעמוד ליוצרים.

    שאלות ותשובות

    כמה טקסט מפרסם פרק פודקאסט ישראלי ממוצע? החציון הוא 384 תווים, כשמונה שורות (N=39,114 שורות פרק). זה מספר רצפה, כי הקוצר שלנו חותך את השדה ב-600 תווים.

    כמה פרקים מתפרסמים בלי תיאור בכלל? 1,287 שורות פרק, 3.3 אחוז מהאינדקס. המספר הזה מדויק ואינו מושפע מהחיתוך.

    מה היחס בין מה שנאמר בפרק למה שפורסם עליו? 73.3 מילים מדוברות על כל מילה מפורסמת, בחציון, על 3,783 פרקים שחוברו לשורת הפיד שלהם. הרבעונים הם 39 : 1 ו-137 : 1.

    איזו קטגוריה הכי דלה בטקסט? יהדות ודת, עם 49.3 אחוז משורות הפרק מתחת ל-200 תווים ו-13.7 אחוז בלי תיאור (N=4,789). הכי מטופחת היא הורות ומשפחה עם 7.2 אחוז בלבד (N=753).

    למה גוגל או ChatGPT לא פשוט מתמללים את הפרק? כי הזחלן מקבל קישור לקובץ אודיו בינארי ולא טקסט. מנוע תשובות מצטט רק מה שקרא, ולכן תוכן שקיים רק כאודיו אינו קיים מבחינתו.

    האם המספרים כאן ניתנים לשחזור? כן. הריצו python3 scripts/mag_israeli-podcast-descriptions-vs-speech.py משורש הריפו. הוא רץ בפחות מדקה ומדפיס כל מספר בכתבה יחד עם ה-N שלו.

    הארכיון שלכם הוא אודיו מת שגוגל ו-ChatGPT לא מוצאים

    כל פרק יכול להיות מאמר עברי שמדורג בגוגל ומצוטט על ידי מנועי הבינה המלאכותית. זה בדיוק מה שעשינו כאן, אוטומטית, על הקורפוס כולו.

    רוצה מגזין כזה לפודקאסט שלך

    הכתבה נכתבה בסיוע בינה מלאכותית על בסיס ניתוח הקורפוס של פודקאסט·ישראל. שיטת החישוב: scripts/mag_israeli-podcast-descriptions-vs-speech.py על data/podcasts.json (כל שורות הפרק המוטמעות, ללא כפילויות guid בתוך תוכנית) מחובר ל-data/transcripts/*__ep<N>.txt דרך ה-guid שבקובץ הלוואי; אורך התיאור נמדד בתווים ובמילים, אורך הדיבור נמדד במילים בקובץ התמלול, והיחס הראשי הוא החציון על תת-הקבוצה שהתיאור שלה מתחת לתקרת 600 התווים ואינו ריק. המספרים ניתנים לשחזור דרך עמוד המתודולוגיה.

    השאר תגובה

    הכנס תגובה
    הכנס את שמך כאן