12,371 אזכורים ל-22 מילים אנגליות: מה באמת יוצא מהפה בפודקאסטים הישראליים

    0
    11

    12,371 פעמים נאמרה מילה אנגלית מתועתקת בתוך משפט עברי, ב-10,947 תמלילים של פודקאסטים ישראליים ובסך הכול 42,365,438 מילים. זו מילה לועזית אחת לכל 3,424 מילים מדוברות. אבל הפיזור אינו אחיד: בפודקאסטי הטכנולוגיה הצפיפות היא 143.3 אזכורים לכל 100 אלף מילים, ובפודקאסטי היהדות 7.0 בלבד, פער של פי 20.5.

    מה נמדד כאן, ובמה זה שונה ממדידת שמות התוכניות

    המדידה הזו נעשתה על התמלילים עצמם, כלומר על מה שיוצא מהפה של המרואיינים והמנחים, ולא על מה שכתוב בכותרת. בסיס הנתונים: 10,947 תמלילים קנוניים של פרקים, מ-2,042 תוכניות שונות, 42,365,438 מילים. 10,824 מהתמלילים שייכים לתוכנית שעדיין נמצאת באינדקס של 3,367 התוכניות, ו-123 שייכים לתוכניות שיצאו ממנו מאז.

    חשוב להפריד את זה ממדידה קודמת שפורסמה כאן. הכתבה 12.8% משמות הפודקאסטים הישראליים כוללים מילה באנגלית ספרה שמות תוכניות, ומצאה 423 מתוך 3,300 שמות שמכילים מילה באותיות לטיניות. זו מדידה אחרת לגמרי: יחידת הספירה שם היא שם תוכנית, כאן היא מילה מדוברת. שתי המדידות לא מתחרות זו בזו ולא מאששות זו את זו, והמספרים שלהן אינם ניתנים להשוואה ישירה. למעשה, כפי שנראה בהמשך, הן מצביעות על שני דברים הפוכים: בכותרות האנגלית בולטת לעין, ובדיבור עצמו היא נדירה הרבה יותר ממה שהתחושה אומרת.

    שיטת הזיהוי היא ביטוי רגולרי עם גבול מילה עברי, ולא חיפוש מחרוזת פשוט. חיפוש מחרוזת בעברית משקר: המילה "דיל" נתפסת בתוך "להבדיל", והמילה "באג" נתפסת בתוך "באג'נדה" ובתוך "באג"ח" אם לא חוסמים גם את הגרש והגרשיים. בבדיקה שלנו, חסימת הגרש לבדה הורידה את "באג" מ-317 אזכורים ל-166, כלומר כמעט מחצית מהתוצאות היו שגויות.

    כרטיס נתונים של מגזין פודקאסט ישראל ובו המספר 143.3, מספר המילים הלועזיות לכל 100 אלף מילים מדוברות בפודקאסטי הטכנולוגיה הישראליים, מול 7.0 בפודקאסטי היהדות
    פודקאסטי הטכנולוגיה מדברים אנגלית בצפיפות של 143.3 אזכורים ל-100 אלף מילים. מדגם: 276 פרקים, 1,055,762 מילים.

    22 המילים שנספרו, וארבע שנפסלו

    נבחנו 26 מילים לועזיות, כולן מילים שיש להן חלופה עברית שגורה. 22 מהן עברו את סף הפרסום שלנו של 30 פרקים לפחות, וארבע לא עברו אותו ולכן אינן נושאות כאן שום סטטיסטיקה: פייפליין (27 פרקים), אאוטפוט (17), בייסיקלי (16) ובוטום ליין (6 פרקים). הן נמדדו, הן קיימות, אבל המדגם קטן מדי מכדי לומר עליו משהו.

    כל הספירות הן של צורת הבסיס בלבד. "טרנדים" ו"באגים" לא נספרים, כי הגבול העברי חוסם כל סיומת. המשמעות המעשית: כל מספר בטבלה הזו הוא רצפה ולא תקרה, והמספר האמיתי גבוה יותר.

    22 המילים, לפי מספר הפרקים שבהם נאמרו

    מדגם: 10,947 תמלילים, 42,365,438 מילים. רחפו מעל עמודה כדי לראות את שלושת המספרים של אותה מילה.

    פלטפורמה723 פרקים
    קונספט690 פרקים
    ביזנס663 פרקים
    פוקוס550 פרקים
    טרנד473 פרקים
    קונטקסט432 פרקים
    פידבק375 פרקים
    ליטרלי321 פרקים
    אימפקט319 פרקים
    אקזיט215 פרקים
    מיינדסט209 פרקים
    סקייל202 פרקים
    פרודקט198 פרקים
    טיימינג187 פרקים
    ברנד183 פרקים
    פרפורמנס129 פרקים
    סטארטאפ103 פרקים
    באג102 פרקים
    אינפוט89 פרקים
    דדליין79 פרקים
    סטייטמנט57 פרקים
    אינסייט32 פרקים

    מקור: scripts/mag_hebrew-podcast-spoken-anglicisms.py על data/transcripts/*__epN.txt (10,947 תמלילים) ועל data/podcasts.json.

    שתי משפחות נפרדות מסתתרות בטבלה. תשע מילים הן שאילות ותיקות שנכנסו לעברית התקנית מזמן (פלטפורמה, קונספט, ביזנס, פוקוס, טרנד, ברנד, אקזיט, סטארטאפ, באג), והן אחראיות ל-7,228 מהאזכורים. שלוש עשרה מילים הן החלפת קוד גולמית, כלומר מילה אנגלית שנאמרת כמו שהיא בתוך משפט עברי (קונטקסט, פידבק, אימפקט, ליטרלי, מיינדסט, סקייל, פרודקט, טיימינג, פרפורמנס, אינפוט, דדליין, סטייטמנט, אינסייט), והן אחראיות ל-5,143 אזכורים. יחד, 12,371 אזכורים ב-10,947 פרקים.

    המילה הנפוצה ביותר היא פלטפורמה, שנאמרה ב-723 פרקים ו-399 תוכניות שונות, 1,514 פעמים. אחריה קונספט (690 פרקים, 1,118 אזכורים, 399 תוכניות) וביזנס (663 פרקים, 1,405 אזכורים, 348 תוכניות). בסך הכול, 3,631 מתוך 10,947 הפרקים בקורפוס, 33.2%, מכילים לפחות מילה אחת מהרשימה.

    ארבע מילים נפסלו לפני הספירה, וחשוב לומר למה. "דיל" נפסלה כי הביטוי נתפס בתוך "להבדיל". "אלגוריתם" נפסלה כי היא לא שאילה מאנגלית והיא המונח העברי התקני, כלומר אין ממה להחליף. "אקטואלי" נפסלה כי היא הגיעה לעברית דרך הגרמנית והרוסית ולא דרך האנגלית. בנוסף, 35 מופעים של "הוקוס פוקוס" הוחסרו מהספירה של "פוקוס", ושני מופעים של שם הקרן "אינסייט פרטנרס" הוחסרו מהספירה של "אינסייט".

    הפער בין הקטגוריות הוא הממצא האמיתי

    ממוצע הקורפוס כולו הוא 29.5 אזכורים לכל 100 אלף מילים (12,437 אזכורים על פני 42,112,551 מילים בתוכניות שעדיין באינדקס). מסביב לממוצע הזה נפרש טווח עצום. הבחרו קטגוריה כדי לראות את המספרים שלה.

    כמה אנגלית מדוברת יש בקטגוריה שלכם

    טכנולוגיה: 143.3 אזכורים לכל 100 אלף מילים, פי 4.9 מממוצע הקורפוס (29.5). 70.7% מהפרקים בקטגוריה מכילים לפחות מילה לועזית אחת. מדגם: 276 פרקים, 1,055,762 מילים.
    קטגוריה פרקים מילים לועזיות ל-100 אלף % פרקים עם לועזית
    טכנולוגיה 276 1,055,762 143.3 70.7%
    עסקים 697 2,678,288 78.3 52.7%
    בריאות 165 542,916 27.6 40.0%
    כללי 6761 24,912,726 24.7 30.7%
    בידור 163 606,551 23.4 34.4%
    תרבות 968 4,498,132 23.4 35.8%
    קומדיה 268 2,202,015 20.8 53.0%
    מדע 255 1,242,235 20.3 35.3%
    תעלומות פשע 72 439,993 20.2 55.6%
    חדשות 169 640,448 20.1 28.4%
    הורות 104 342,417 17.8 23.1%
    היסטוריה 206 602,914 13.4 18.0%
    חינוך 605 1,933,291 12.3 19.0%
    יהדות 115 414,863 7.0 13.0%

    כל הקטגוריות באינדקס עברו את סף 30 הפרקים, ולכן אף אחת מהן לא הושמטה. מקור: scripts/mag_hebrew-podcast-spoken-anglicisms.py.

    הקצה העליון הוא טכנולוגיה, 143.3 אזכורים ל-100 אלף מילים על פני 276 פרקים, ואחריו עסקים, 78.3 על פני 697 פרקים. הקצה התחתון הוא יהדות, 7.0 על פני 115 פרקים, ולפניו חינוך, 12.3 על פני 605 פרקים, והיסטוריה, 13.4 על פני 206 פרקים. היחס בין הקצוות הוא פי 20.5. גם שיעור הפרקים שמכילים לפחות מילה אחת נע באותו כיוון: 70.7% בטכנולוגיה מול 13.0% ביהדות.

    ברמת התוכנית הבודדת הפער חד עוד יותר, אבל כאן צריך זהירות. רק 17 תוכניות בקורפוס מגיעות ל-30 תמלילים או יותר, ולכן רק עליהן מותר לומר משהו. הצפופה מביניהן היא מבט לאחור, תוכנית עסקים עם 160.0 אזכורים ל-100 אלף מילים על פני 56 פרקים ו-652,583 מילים. בתחתית אותן 17 תוכניות עומדות תוכניות שיח ופוליטיקה עם 5.6 עד 7.3 אזכורים ל-100 אלף.

    כרטיס נתונים של מגזין פודקאסט ישראל ובו המספר 723, מספר הפרקים שבהם נאמרה המילה פלטפורמה, המילה הלועזית הנפוצה ביותר בקורפוס
    פלטפורמה היא המילה הלועזית הנפוצה ביותר: 723 פרקים, 1,514 אזכורים, 399 תוכניות שונות.

    איך זה נשמע בתוך משפט אמיתי

    הדיאגרמה למטה לוקחת שני משפטים אמיתיים מהתמלילים, אחד מתוכנית טכנולוגיה ואחד מתוכנית בריאות, ומראה את המנגנון: איזו מילה הושאלה, מה החלופה העברית שלה, וכמה פרקים אומרים אותה. אפשר להחליף בין המשפטים ולפתוח כל מילה מסומנת.

    מנגנון ההשאלה, בשני משפטים אמיתיים

    תוכנית טכנולוגיה: יזמות ופרודקט – Founders & Product, פרק "היזמת שבונה בית למיקרו-ברנדים"

    ברנדים גדולים, קודם כל, מי שקם בבוקר להקים ברנד גדול משמעותי, המיינדסט שלו הוא טיפה אחר, הרבה חושבים על זה בצורה אחרת, הם מגיעים עם הפנדינג הנכון, הם מגיעים עם המיינדסט הנכון.

    שתי המילים המסומנות: ברנד (חלופה עברית: מותג) נאמרת ב-183 פרקים, 471 אזכורים. מיינדסט (חלופה עברית: תפיסה) נאמרת ב-209 פרקים, 446 אזכורים. שימו לב ש"ברנדים" בפתח המשפט לא נספר כלל, כי הספירה היא של צורת הבסיס בלבד, וכך גם "פנדינג" שאינה ברשימת 26 המילים.
    תוכנית בריאות: בריאה ומאושרת עם פאולה רוזנברג, פרק "היתרונות המפתיעים של חמלה עצמית לבריאות שלך"

    אני יודעת שהגרטיטיוד והכרה תודה זה משהו שהפך להיות טרנד מאוד מאוד נפוץ, אבל באמת, מדי יום לשים את הפוקוס גם לדברים שאנחנו מכירות עליהם תודה, זה עוזר לפתח חמלה עצמית.

    שתי המילים המסומנות: טרנד (חלופה עברית: מגמה) נאמרת ב-473 פרקים, 909 אזכורים. פוקוס (חלופה עברית: מיקוד) נאמרת ב-550 פרקים, 943 אזכורים. "גרטיטיוד" באותו משפט היא שאילה גמורה שאינה ברשימת 26 המילים, ולכן אינה נספרת. זו בדיוק הסיבה שכל המספרים כאן הם רצפה.
    1. מקצוע מייבא מילה. המונח נכנס עם המקצוע עצמו. ככל שהתחום צעיר יותר ומיובא יותר, כך יש פחות מילה עברית שגורה, ולכן טכנולוגיה עומדת על 143.3 אזכורים ל-100 אלף מילים ויהדות על 7.0.
    2. הדיבור מאמץ אותה מיד. בדיבור אין עורך לשון. 3,631 מתוך 10,947 הפרקים, 33.2%, מכילים לפחות מילה אחת מהרשימה.
    3. הכתיבה מאמצת אותה חלקית. בכותרות של פרקים ותוכניות המילה הלועזית נכתבת פעמים רבות בעברית, פעמים אחרות באנגלית, ופעמים רבות מוחלפת בחלופה העברית התקנית. כך נוצר פער בין מה שנאמר לבין מה שנכתב.
    4. החיפוש נופל בין הכיסאות. מאזין שמחפש "מיינדסט" לא ימצא עמוד שכתוב בו "תפיסה", ולהפך. המילה נאמרה ב-209 פרקים, אבל אם היא לא מופיעה בשום טקסט שגוגל יכול לקרוא, היא לא קיימת.

    הציטוטים הועתקו מהתמלילים כלשונם, כשרצפי רווחים כווצו לרווח יחיד. מקור: scripts/mag_hebrew-podcast-spoken-anglicisms.py.

    המשפט המדגים הכי טוב את הפער נמצא דווקא בתוכנית העסקים הצפופה ביותר בקורפוס, מבט לאחור, שבה נאמרו המילה העברית והמילה האנגלית באותו משפט ממש: "עסק שמכניס כסף, זאת אומרת, זה ביזנס אמיתי, והוא מכניס כסף, רק שלפחות במדינת ישראל, כמות הכסף שתוכל להכניס מעסק יכולה להיות מאוד יפה ויכול להיות סכומים מאוד מאוד יפים, אבל זה לא יתקרב לאקזיט של יזם." בתוכנית כושר ניהול זה נשמע כך: "זה יכול להספיק לי, אבל אם אתה בונה ביזנס שהוא בסקייל יחסית גבוה, מדבר להמון קהלים, אתה צריך למצוא את הדרך, לא יעזור." ובתוכנית Product Builder | פרודקט בילדר בשש מילים: "ולהבין רגע על מה אני שם הפוקוס ואיך אני עושה אימפקט."

    האנגלית באותיות לטיניות היא סיפור אחר לגמרי

    לצד המילים המתועתקות ספרנו גם כמה מהמילים בקורפוס מכילות בכלל אות לטינית. התשובה: 549,967 מתוך 42,365,438, כלומר 1.30%. זה נשמע כמו מספר קטן, והוא באמת קטן, אבל הוא גם מטעה, כי הוא לא מפוזר.

    הפרק החציוני בקורפוס מכיל 0.09% מילים עם אות לטינית, כלומר כמעט אפס (מדגם: 10,947 פרקים). 3,821 פרקים לא מכילים ולו מילה אחת עם אות לטינית. ובקצה השני, 138 פרקים בלבד, 1.3% מהקורפוס, מורכבים ב-20% ומעלה ממילים לטיניות, והם לבדם מחזיקים 66.5% מכל המילים הלטיניות בקורפוס כולו. במילים אחרות: שני שלישים מהאנגלית הכתובה בתמלילים אינם החלפת קוד, אלא פרקים שמתנהלים באנגלית מלאה, בדרך כלל עם אורח דובר אנגלית.

    החלפת הקוד האמיתית באותיות לטיניות היא קטנה בהרבה: 30,963 מילים בקורפוס, 0.073%, מערבבות עברית ולטינית בתוך אותה מילה אחת. אלה הצורות שבהן תחילית עברית נדבקת לראשי תיבות אנגליים. הצורה הנפוצה ביותר היא "ה-AI" עם 2,229 מופעים, אחריה "ב-AI" עם 886, "ה-DNA" עם 480 ו"ל-AI" עם 373. זו החלפת קוד במובן המובהק ביותר שאפשר למדוד: מורפולוגיה עברית על גבי מילה אנגלית.

    גם צפיפות האותיות הלטיניות משתנה לפי קטגוריה, אבל לא באותו סדר. הצפופה ביותר היא תרבות, 18.8 מילים לטיניות לכל 1,000 מילים על פני 968 פרקים. הדלילה ביותר היא הורות, 1.3 לכל 1,000 על פני 104 פרקים. היחס הוא פי 15.0. העובדה ששני הדירוגים אינם זהים היא בדיוק העניין: מילה לועזית שנאמרת ומילה לועזית שנכתבת אינן אותה תופעה.

    כרטיס נתונים של מגזין פודקאסט ישראל ובו המספר 66.5 אחוז, חלקם של 138 פרקים דוברי אנגלית מתוך כלל המילים באותיות לטיניות בקורפוס
    66.5% מכל המילים באותיות לטיניות בקורפוס יושבות ב-138 פרקים בלבד, שהם 1.3% מהפרקים.

    מה זה אומר למי שמפיק פודקאסט

    המסקנה המעשית פשוטה, והיא נובעת ישירות מהמספרים. אם התוכנית שלכם בקטגוריית טכנולוגיה או עסקים, השיח בפרק מכיל מילים לועזיות בצפיפות של 143.3 או 78.3 לכל 100 אלף מילים, והמאזינים שלכם מחפשים בדיוק במילים האלה. אם אין שום טקסט של הפרק ברשת, לא תמליל ולא סיכום, אף אחת מ-12,371 המילים האלה אינה קיימת מבחינת מנוע חיפוש או מבחינת מודל שפה שמנסה לצטט מקור.

    וההפך נכון גם הוא. אם התוכנית שלכם בקטגוריית יהדות, היסטוריה או חינוך, שם הצפיפות היא 7.0 עד 13.4, השפה שלכם עברית כמעט לחלוטין, וזה יתרון: התוכן שלכם מדבר בדיוק בשפה שבה קהל ישראלי מחפש, בלי שכבת תרגום. הבעיה שלכם אינה השפה אלא הנראות.

    שני המצבים מצביעים על אותו פתרון. ארכיון של פודקאסט הוא היום אודיו שגוגל ומנועי הבינה המלאכותית לא יכולים לקרוא. הכתבה הזו עצמה נכתבה על גבי תמלילים, וזה בדיוק המנגנון שהופך ארכיון מת למאגר שאפשר לצטט. איך זה עובד בעמוד היוצרים.

    שאלות ותשובות

    כמה מילים אנגליות באמת נאמרות בפודקאסטים הישראליים?
    12,371 אזכורים של 22 מילים אנגליות מתועתקות, ב-10,947 תמלילים שמכילים 42,365,438 מילים. זו מילה אחת לכל 3,424 מילים מדוברות, 0.029% מכלל המילים.

    איזו מילה אנגלית נאמרת הכי הרבה?
    "פלטפורמה", ב-723 פרקים ו-399 תוכניות שונות, 1,514 אזכורים. אחריה "קונספט" (690 פרקים) ו"ביזנס" (663 פרקים).

    אילו פודקאסטים מדברים הכי הרבה אנגלית?
    פודקאסטי טכנולוגיה, 143.3 אזכורים לכל 100 אלף מילים על פני 276 פרקים, ואחריהם פודקאסטי עסקים, 78.3 על פני 697 פרקים. הכי מעט: פודקאסטי יהדות, 7.0 על פני 115 פרקים.

    האם זה אותו ממצא כמו האנגלית בשמות התוכניות?
    לא. המדידה של שמות התוכניות מצאה 423 מתוך 3,300 שמות עם מילה לטינית, 12.8%. זו יחידת ספירה אחרת (שם תוכנית מול מילה מדוברת) ומקור נתונים אחר (data/podcasts.json מול התמלילים), ולכן אי אפשר להשוות בין שני האחוזים.

    איך חישבנו: corpus_query = scripts/mag_hebrew-podcast-spoken-anglicisms.py, שרץ משורש המאגר בלי ארגומנטים. נספרו רק תמלילים קנוניים, כלומר כל data/transcripts/*.txt ששמו תואם __epN.txt, ולא כפילויות iCloud מסוג "__epN 2.txt". המילים הלועזיות זוהו בביטוי רגולרי עם גבול עברי ותחילית אחת אופציונלית מתוך והבלמכש, כשגם גרש וגרשיים חוסמים את הגבול. נספרה צורת הבסיס בלבד, ולכן כל מספר הוא רצפה. הקטגוריה נלקחה מ-data/podcasts.json לפי שם הקובץ. אף שדה שנוצר בבינה מלאכותית לא שימש כאן: הספירה נעשתה על התמלילים הגולמיים בלבד. צילום המצב: 31 באוגוסט 2026, 10,947 תמלילים. הקורפוס גדל מדי יום, ולכן הרצה מאוחרת יותר תחזיר מספרים גבוהים במעט.

    הכתבה נכתבה בסיוע בינה מלאכותית על בסיס ניתוח הקורפוס של פודקאסט·ישראל. כל המספרים חושבו מחדש מהנתונים בזמן הכתיבה וניתנים לשחזור דרך הסקריפט הנקוב למעלה ודרך עמוד המתודולוגיה.

    השאר תגובה

    הכנס תגובה
    הכנס את שמך כאן