פייסבוק הוא המותג שנאמר בקול ביותר פרקים ישראליים: 1,724 פרקים מתוך 10,948 תמלולים, 15.7 אחוז מכל מה שתמללנו, לפני אינסטגרם עם 1,478 ולפני גוגל עם 1,379. זו מדידה של דיבור ולא של שימוש, והיא מציירת תמונה מאחרת בכמה שנים של תשומת הלב הישראלית. הנתון נמדד ישירות מהתמלולים, לא מסקר ולא מהערכה של פאנל.

מי נאמר, ובכמה פרקים
ספרנו כל שם מותג ופלטפורמה על פני 10,948 התמלולים הקנוניים של הקורפוס, וספרנו שני דברים נפרדים: בכמה פרקים השם נאמר לפחות פעם אחת, וכמה פעמים הוא נאמר בסך הכול. שתי הספירות לא מספרות אותו סיפור. גוגל, למשל, נמצא ב-1,379 פרקים בלבד אך נאמר 3,595 פעמים, כמעט בדיוק כמו פייסבוק עם 3,598 אזכורים בתוך 1,724 פרקים. גוגל מוזכר בפחות פרקים אבל חוזר יותר בתוך כל פרק שבו הוא כן עולה.
4,745 פרקים, 43.3 אחוז מהקורפוס, מזכירים לפחות אחת מתשע הפלטפורמות הגלובליות המרכזיות. קרוב לחצי מהשיחה המוקלטת בעברית נוגעת בשם של חברת טכנולוגיה זרה, בלי קשר לנושא הפרק.
דירוג הפלטפורמות, לפי מספר פרקים
N=10,948 תמלולים קנוניים. העבירו את העכבר על עמודה לערכים המלאים.
| פייסבוק | 1,724 | |
|---|---|---|
| אינסטגרם | 1,478 | |
| גוגל | 1,379 | |
| יוטיוב | 1,286 | |
| ווטסאפ | 1,264 | |
| טיקטוק | 805 | |
| ספוטיפיי | 773 | |
| טוויטר | 613 | |
| נטפליקס | 399 | |
| אמזון | 326 | |
| טלגרם | 273 | |
| מיקרוסופט | 268 |
מקור: data/transcripts/*__epN.txt, 10,948 התמלולים הקנוניים, ספירת שמות מותג עם הביטוי (?<![א-ת])[והבלמכש]?TERM(?![א-ת]), מיזוג וריאנטים של תעתיק לכל מותג, והצלבה מול itunes_genre דרך slug התוכנית ב-data/podcasts.json. הסקריפט: scripts/mag_israeli-podcasts-platform-names.py
מה לא נספר, ולמה
הבעיה הגדולה בספירת מותגים בעברית היא שחלק משמות המותג הם גם מילים רגילות. בדקנו כל מונח על מדגם קריאה של לפחות עשרים קטעים לפני שהוא נכנס לטבלה, וכל מונח שלא עבר את הבדיקה נזרק לגמרי במקום להתפרסם עם מספר מנופח.
אפל נזרק. המילה גם משמשת כשם תואר, ולכן היא נמדדת יחד עם "עבר אפל" או "יותר אפל". המונח היה מגיע ל-968 פרקים ו-2,335 אזכורים, מקום חמישי, אלא ש-2,040 מהם אינם צמודים לשם מוצר של החברה, כך שאין דרך אוטומטית להפריד בין החברה לשם התואר. אובר נזרק מאותה סיבה בכיוון האנגלי: 853 אזכורים, ורבים מהם "אובר תינקינג", "אול אובר" או "אובר פרייס". זום נזרק עם 1,779 אזכורים, כי "זום אין" ו"זום אאוט" הם אותה מילה. ווייז נזרק עם 737 אזכורים, ש-291 מהם עומדים לפני גרש, כלומר "וויז'ן" ו"וויז'ואל". אל על נזרק משום שהתחילית הישראלית הופכת את "שאל על" לזיהוי שגוי מושלם.
גם נייס, פייס, וולט ופייבר נזרקו, כל אחד מהם משום שהוא נשמע בעברית בדיוק כמו מילה שאינה מותג. נשמע קטנוני, אבל זו הנקודה שבה ניתוח קורפוס מייצר כותרת שקרית.
ובכיוון ההפוך, איחוד תעתיקים משנה דירוגים. טיקטוק בכתיב מחובר נמצא ב-474 פרקים בלבד, אבל "טיק טוק" בשתי מילים נמצא ב-404 נוספים ו"טיק-טוק" במקף בעוד 71. האיחוד מביא את טיקטוק ל-805 פרקים ו-2,127 אזכורים, קפיצה של 331 פרקים ומקום שישי במקום שמיני. מיקרוסופט קיצוני עוד יותר: הכתיב "מייקרוסופט" מופיע ב-255 פרקים והכתיב "מיקרוסופט" רק ב-38. לינקדאין מתפצל כמעט לחצי בין שני כתיבים, 120 ו-96, ומגיע ל-207 פרקים באיחוד. ווטסאפ מאחד 1,234, 46 ואחד לכדי 1,264 פרקים.
שני מותגים ישראליים ידועים נמצאו מתחת לסף הדיווח שלנו של 30 פרקים ולכן אינם מקבלים אחוז בכתבה הזו: צ'ק פוינט ומובילאיי. גם השמות הלטיניים Facebook ו-Claude נמצאים מתחת לסף. היעדרות היא ממצא, אבל היא לא שיעור.

פער הקטגוריות: פשע אמיתי מול יהדות
חיברנו כל תמלול לתוכנית שממנה הוא בא, ואת התוכנית לקטגוריית ה-itunes_genre שלה. התוצאה היא הפער הגדול ביותר בכתבה. בקטגוריית פשע אמיתי, 80.6 אחוז מהפרקים מזכירים לפחות פלטפורמה גלובלית אחת, על בסיס 72 פרקים מתומללים. בקטגוריית יהדות, על בסיס 919 פרקים, השיעור הוא 12.1 אחוז. פער של פי 6.7, בתוך אותו קורפוס ואותה שפה.
שיווק עומד על 76.5 אחוז מתוך 196 פרקים, קומדיה על 75.4 אחוז מתוך 268, טכנולוגיה על 66.2 אחוז מתוך 275. בתחתית, סיפורים לילדים על 8.3 אחוז מתוך 120 וקורסים על 9.4 אחוז מתוך 85. הצגנו 59 קטגוריות שיש להן לפחות 30 פרקים מתומללים, יחד 10,415 פרקים; 37 קטגוריות נוספות ירדו מהטבלה כי הן קטנות מדי מכדי לפרסם עליהן שיעור.
הפירוט מגלה גם היפוך מעניין. בקומדיה אינסטגרם עוקף את פייסבוק, 42.9 אחוז מול 36.6, והיא הקטגוריה הגדולה היחידה שבה זה קורה בפער כזה. בפוליטיקה המצב הפוך לחלוטין: פייסבוק ב-15.9 אחוז מהפרקים ואינסטגרם ב-5.9 בלבד, ובחדשות יומיות הפער קיצוני עוד יותר, 31.3 אחוז מול 2.0. פוליטיקה ישראלית מדוברת עדיין מתנהלת סביב פייסבוק.
בדקו קטגוריה
בקטגוריית פשע אמיתי, מתוך 72 פרקים מתומללים, 80.6 אחוז מזכירים לפחות פלטפורמה גלובלית אחת. פייסבוק מוזכר ב-44.4 אחוז מהפרקים ואינסטגרם ב-36.1 אחוז.
| קטגוריה | פרקים | כל פלטפורמה | פייסבוק | אינסטגרם |
|---|---|---|---|---|
| פשע אמיתי | 72 | 80.6 | 44.4 | 36.1 |
| שיווק | 196 | 76.5 | 39.8 | 40.3 |
| קומדיה | 268 | 75.4 | 36.6 | 42.9 |
| ראיונות מוזיקה | 41 | 68.3 | 31.7 | 46.3 |
| מדריכים | 34 | 67.6 | 14.7 | 38.2 |
| טכנולוגיה | 275 | 66.2 | 26.5 | 12.7 |
| חדשות טכנולוגיה | 60 | 65.0 | 33.3 | 30.0 |
| ביקורות קולנוע | 47 | 63.8 | 19.1 | 23.4 |
| חדשות בידור | 78 | 60.3 | 16.7 | 35.9 |
| חדשות יומיות | 147 | 59.9 | 31.3 | 2.0 |
| פוטבול | 32 | 59.4 | 25.0 | 6.2 |
| תזונה | 54 | 59.3 | 16.7 | 40.7 |
| יזמות | 178 | 57.9 | 29.8 | 14.0 |
| פוליטיקה | 542 | 57.2 | 15.9 | 5.9 |
| השקעות | 483 | 56.7 | 19.0 | 13.5 |
| ראיונות קומדיה | 76 | 55.3 | 17.1 | 27.6 |
| אוכל | 80 | 53.8 | 10.0 | 30.0 |
| עסקים | 697 | 53.5 | 20.8 | 18.2 |
| רפואה משלימה | 70 | 52.9 | 4.3 | 17.1 |
| כושר | 36 | 52.8 | 11.1 | 33.3 |
| חברה ותרבות | 596 | 52.5 | 25.0 | 19.6 |
| פרשנות מוזיקלית | 40 | 52.5 | 7.5 | 15.0 |
| מוזיקה | 233 | 52.4 | 20.6 | 13.7 |
| ספורט | 213 | 52.1 | 14.6 | 11.7 |
| כדורסל | 68 | 51.5 | 13.2 | 11.8 |
| קריירה | 131 | 51.1 | 18.3 | 16.0 |
| פרשנות חדשות | 53 | 50.9 | 13.2 | 3.8 |
| טלוויזיה וקולנוע | 110 | 48.2 | 13.6 | 7.3 |
| הורות | 172 | 47.7 | 14.5 | 20.9 |
| כדורגל | 417 | 47.5 | 8.4 | 17.3 |
| יומנים אישיים | 78 | 47.4 | 20.5 | 20.5 |
| עיצוב | 49 | 46.9 | 20.4 | 18.4 |
| זוגיות | 234 | 45.7 | 19.7 | 21.4 |
| מקומות וטיולים | 35 | 45.7 | 17.1 | 17.1 |
| התפתחות אישית | 447 | 45.2 | 22.1 | 15.4 |
| חדשות | 169 | 43.8 | 10.1 | 8.9 |
| פנאי | 53 | 41.5 | 15.1 | 26.4 |
| בריאות הנפש | 205 | 41.0 | 12.7 | 10.2 |
| בריאות וכושר | 165 | 40.6 | 18.2 | 19.4 |
| ילדים ומשפחה | 104 | 38.5 | 14.4 | 14.4 |
| ניהול | 81 | 37.0 | 13.6 | 2.5 |
| ספרים | 258 | 34.1 | 20.9 | 13.6 |
| חדשות ספורט | 43 | 32.6 | 18.6 | 4.7 |
| היסטוריה | 206 | 31.1 | 13.6 | 2.9 |
| אמנות | 140 | 30.0 | 3.6 | 9.3 |
| תיעודי | 87 | 29.9 | 6.9 | 4.6 |
| ממשל | 35 | 28.6 | 11.4 | 2.9 |
| חינוך לילדים | 92 | 28.3 | 6.5 | 5.4 |
| מדע | 255 | 28.2 | 10.2 | 3.1 |
| רפואה | 72 | 27.8 | 16.7 | 5.6 |
| היסטוריה של המוזיקה | 41 | 26.8 | 24.4 | 0.0 |
| חינוך והשכלה | 605 | 25.5 | 7.1 | 6.4 |
| אמנות חזותית | 33 | 24.2 | 3.0 | 3.0 |
| דת ורוחניות | 115 | 20.9 | 7.8 | 5.2 |
| פילוסופיה | 91 | 15.4 | 3.3 | 3.3 |
| רוחניות | 99 | 13.1 | 4.0 | 2.0 |
| יהדות | 919 | 12.1 | 2.4 | 1.5 |
| קורסים | 85 | 9.4 | 1.2 | 4.7 |
| סיפורים לילדים | 120 | 8.3 | 2.5 | 3.3 |
מקור: data/transcripts/*__epN.txt, 10,948 התמלולים הקנוניים, ספירת שמות מותג עם הביטוי (?<![א-ת])[והבלמכש]?TERM(?![א-ת]), מיזוג וריאנטים של תעתיק לכל מותג, והצלבה מול itunes_genre דרך slug התוכנית ב-data/podcasts.json. הסקריפט: scripts/mag_israeli-podcasts-platform-names.py

אזכור או קרדיט: איפה בפרק נאמר השם
לא כל אזכור נולד שווה. חלק מהשמות נאמרים בתוך השיחה, וחלק בפתיח או בקרדיטים, כשהמנחה מבקש מהמאזינים לעקוב. סימנו לכל אזכור את מיקומו היחסי בקובץ: חמישה האחוזים הראשונים, חמישה האחרונים, או תשעים האחוזים שבאמצע. עשרה אחוזים בקצוות הם הציפייה חסרת המשמעות, כי זה בדיוק גודלם.
ספוטיפיי מגיע ל-45.4 אחוז בקצוות, מתוך 1,229 אזכורים, ומתוכם 432 בחמישה האחוזים האחרונים של הפרק. כלומר כמעט מחצית מנוכחות ספוטיפיי בקורפוס אינה שיחה על ספוטיפיי אלא קרדיט. טלגרם עומד על 31.6 אחוז מתוך 674 אזכורים, יוטיוב על 22.3 אחוז מתוך 2,627. בקצה השני, מיקרוסופט על 7.2 אחוז מתוך 811 אזכורים, אינטל על 6.1 מתוך 280 וגוגל על 13.2 מתוך 3,595. פייסבוק עומד על 19.6 אחוז, כלומר 2,894 מתוך 3,598 האזכורים שלו יושבים בגוף הפרק ולא בקרדיטים.
כך נשמע אזכור שהוא קרדיט, מתוך פרק של פודקאסט הצומת: "אתם יכולים לשמוע אותנו בכל אחת מהאפליקציות הפודקאסטים המובילות, אפל פודקאסט, ספוטיפיי, יוטיוב." זה משפט שחוזר כמעט מילה במילה בכל פרק של התוכנית, וזו בדיוק הסיבה שדירוג נאיבי היה מציב את ספוטיפיי גבוה מכפי שמגיע לו.

פייסבוק, שכולם מספידים
המספר המעניין ביותר בכתבה הוא לא הגודל של פייסבוק אלא הפער בין הגודל הזה לבין מה שאומרים עליו. בפרק של בוקר חדש, בשיחה על השפה של דור אלפא, נאמר במפורש: "ככה מת הפייסבוק. נכון. כי צעירים ברחו ממנה לאינסטגרם, ואז לטיק טוק". באותו קורפוס עצמו, פייסבוק נאמר ב-1,724 פרקים ואינסטגרם ב-1,478, פער של 246 פרקים לטובת המת.
פודקאסטים אינם דגימה של בני נוער. הם שיחה של מבוגרים על עסקים, פוליטיקה ותקשורת, שלושה תחומים שבהם פייסבוק עדיין תשתית עבודה ולא זיכרון. גם ההקשר משתנה: חלק מהאזכורים אינם על השימוש ברשת אלא על החברה, כמו בפרק של עושים היסטוריה שנפתח במשפט "בשלהי שנת 2021 הטיל מארק צוקרברג, מייסדה של פייסבוק, פצצה וירטואלית על עולם ההייטק." זו לא שיחה על פיד, זו שיחה על תאגיד.
המותגים הישראליים כמעט לא נשמעים
הצד השני של הטבלה חשוב לא פחות. המותג הישראלי המוזכר ביותר שעבר את סף הדיווח הוא בנק הפועלים, ב-83 פרקים ו-135 אזכורים. אחריו רמי לוי ב-79 פרקים, ויקס ב-77, בנק לאומי ב-67 ושופרסל ב-44. פער של פי עשרים ויותר מול פייסבוק, על אותו קורפוס בדיוק.
שתי קריאות אפשריות: שהשיחה המוקלטת עוסקת בעולם ולא בשוק המקומי, או שמותגים ישראליים פשוט לא נמצאים שם כי איש לא בנה עבורם נוכחות. ביטקוין נאמר ב-136 פרקים ו-699 אזכורים, יותר מכל מותג ישראלי בקורפוס, וביטוח לאומי ב-247 פרקים ו-460 אזכורים, יותר מכל בנק.
בכתיב לטיני, שנספר בנפרד, ChatGPT מופיע ב-114 פרקים ו-243 אזכורים, OpenAI ב-91 פרקים ו-269 אזכורים ו-Nvidia ב-64 פרקים ו-139 אזכורים. אלה שמות שהמנחים כותבים ומבטאים באנגלית, ולכן הם נספרים בשדה נפרד מן העברית. עוד על התחום הזה בעמוד הנושא בינה מלאכותית ובעמוד ההייטק.

המנגנון: שם שנאמר באודיו אינו קיים עד שמתמללים אותו
הסיבה טכנית ופשוטה: מותג שנאמר בקול אינו טקסט. מנוע חיפוש לא רואה אותו, מערכת ניטור מותג לא סופרת אותו, ומי שמנהל את המותג לא יידע לעולם שדיברו עליו במשך שבע דקות. השרשרת שמתחת ממחישה איפה בדיוק השם נעלם ואיפה הוא חוזר להיות נראה.
הדרך של אזכור מותג, משמע לנתון
חמישה שלבים. אפשר לצעוד בהם אחד אחד, וללא JavaScript כולם פתוחים.
- שלב 1. מותג נאמר בפרקמנחה או אורח אומר שם של חברה בתוך שיחה. ברגע הזה האזכור קיים רק בגל קול.
- שלב 2. האודיו אינו טקסטקובץ שמע אינו ניתן לחיפוש. אין מילה, אין אינדקס, אין ספירה. זהו השלב שבו רוב אזכורי המותג בעולם הפודקאסטים נעלמים.
- שלב 3. תמלולהפרק עובר תמלול אוטומטי בעברית. 10,948 פרקים בקורפוס הזה עברו את השלב הזה, ורק הם נספרו כאן.
- שלב 4. זיהוי שם עם גבולותהשם נמצא בטקסט עם ביטוי שמכבד תחיליות עבריות, ואחרי איחוד תעתיקים. בלי השלב הזה טיקטוק היה נספר ב-474 פרקים במקום 805.
- שלב 5. ספירה, הקשר והתראההאזכור מקבל תאריך, תוכנית, קטגוריה ומיקום בתוך הפרק. רק עכשיו אפשר לדעת שדיברו עליכם, מתי, ובאיזה הקשר.
השלב האחרון הוא בדיוק מה שמערכת ההתראות שלנו עושה על הקורפוס הזה: מחפשת שם מותג בתוך התמלולים ומדווחת היכן הוא נאמר.
שאלות ותשובות
האם 10,948 פרקים מייצגים את הפודקאסטים בישראל? הם מייצגים את מה שתומלל, לא את מה ששודר. האינדקס מכיל 3,367 תוכניות, והתמלולים מכסים חלק מהן; 10,825 מהתמלולים מתחברים לתוכנית שעדיין נמצאת באינדקס ו-123 שייכים לתוכניות שיצאו ממנו. כל האחוזים בכתבה מחושבים מתוך 10,948 ולא מתוך הקורפוס כולו.
למה אין כאן אפל, אובר או זום? כי המילים האלה בעברית אינן רק שמות מותג, וספירה שלהן הייתה מייצרת מספרים גדולים ולא נכונים. ההחלטה, והמספרים שהיו מתקבלים, מודפסים בגלוי על ידי הסקריפט כדי שאפשר יהיה לבדוק אותה.
אזכור אחד ואזכור חוזר נספרים אותו דבר? לא. יש שתי ספירות נפרדות לאורך כל הכתבה: מספר הפרקים שבהם השם נאמר לפחות פעם אחת, ומספר האזכורים הכולל. אפשר להחליף ביניהן בגרף שלמעלה.
מה עושים עם זה? אם אתם מותג, זה אומר שקיימת שכבת שיחה שלמה עליכם שאינה מנוטרת. אם אתם יוצרי פודקאסט, זה אומר שהתוכן שלכם מכיל ישויות מסחריות שמעניינות מישהו, ברגע שהוא הופך לטקסט.
הבסיס הוא 10,948 קובצי תמלול קנוניים בלבד, לפי התבנית __epN.txt, בלי כפילויות iCloud. כל מונח נספר עם ביטוי גבולות עברי שמאפשר תחילית אחת ומונע התאמה בתוך מילה אחרת, וריאנטים של תעתיק אוחדו לכל מותג לפני שהפרק נספר. הקטגוריות נגזרות מ-itunes_genre של התוכנית, וכל קטגוריה עם פחות מ-30 פרקים מתומללים הושמטה. הציטוטים הועתקו מילה במילה מהתמלול, כאשר מעברי שורה מוצגים כרווח, וכל פרק מצוטט מקושר לעמוד שלו. המספרים מוקפאים על מצב הקורפוס בזמן הכתיבה, 10,948 תמלולים; התמלול ממשיך לרוץ ברקע, ולכן הרצה חוזרת תראה מספר מעט גדול יותר, בלי שינוי בדירוג או באחוזים. corpus_query: data/transcripts/*__epN.txt, 10,948 התמלולים הקנוניים, ספירת שמות מותג עם הביטוי (?<![א-ת])[והבלמכש]?TERM(?![א-ת]), מיזוג וריאנטים של תעתיק לכל מותג, והצלבה מול itunes_genre דרך slug התוכנית ב-data/podcasts.json. הסקריפט: scripts/mag_israeli-podcasts-platform-names.py. הנתונים ניתנים לשחזור מלא, ראו גם עמוד המתודולוגיה ונתוני השוק.
כל מספר בכתבה הזו הופק מטקסט שלא היה קיים עד שהפרק תומלל. כך גם ארכיון של תוכנית: כל עוד הוא אודיו בלבד, הוא לא נספר, לא נמצא בחיפוש ולא מצוטט על ידי מנועי בינה מלאכותית. ברגע שהוא הופך לטקסט, הוא נכס שאפשר למדוד. כך אנחנו הופכים ארכיון פודקאסט למגזין שנמצא בחיפוש.
הכתבה נכתבה בסיוע בינה מלאכותית על בסיס ניתוח הקורפוס של פודקאסט·ישראל. כל המספרים חושבו מחדש מהנתונים בזמן הכתיבה וניתנים לשחזור.


