19,322,192 מילים: מה מצאנו כשספרנו את כל העברית המדוברת בפודקאסטים הישראליים

0
40
איור: הר של בועות דיבור קטנות שנמדד בסרט מדידה

19,322,192 מילים

זה מספר המילים שמכונת התמלול כתבה מתוך 8,068 פרקי פודקאסט ישראליים, 1,718 תוכניות שונות, 5,257 שעות אודיו. בתוכן 556,024 צורות מילה נבדלות. עד היום אף אחד לא ספר עברית מדוברת בהיקף כזה, פשוט כי אף אחד לא החזיק את ההקלטות במקום אחד.

המספר הזה הוא לא הישג. הוא נקודת מוצא לשאלה אחרת: איך נשמעת עברית כשמישהו סוף סוף כותב אותה במלואה, בלי עורך.

קודם כל, מה זרקנו

על הדיסק יש 8,965 קבצי תמלול. אחרי ניקוי נשארו 8,068. הנה בדיוק מה ירד ולמה, כי בלי זה כל מספר בהמשך חסר ערך.

  • 683 קבצים בעלי שם כפול שנוצרו מסנכרון iCloud. ל-546 מהם היה תאום קנוני, והם ירדו. 137 שרדו כי הם היו העותק היחיד.
  • 119 קבוצות של קבצים זהים לחלוטין בתוכן, לפי חתימת SHA-1. ירדו עוד 126 קבצים.
  • 157 קבצים מנוונים. ההגדרה: השורה הנפוצה ביותר בקובץ חוזרת 10 פעמים או יותר, וגם מהווה 20 אחוז ומעלה מכלל השורות בו. אלה תמלולים שקרסו, בדרך כלל על מוזיקה או על אודיו גרוע.
  • 78 קבצים מתחת ל-100 מילים, כלומר תמלול שנכשל.

הכשל השכיח ביותר ראוי לשם. בקובץ אחד השורה "תודה רבה." חוזרת 98 פעמים ברצף וזה כל התמלול. בקובץ אחר שורת ג'יבריש בת ארבע מילים חוזרת 534 פעמים. בסך הכל הניקוי הוריד 312,902 מילים, 1.59 אחוז מכל מה שנכתב.

24 מילים מחזיקות את השפה

24 הצורות הנפוצות ביותר בקורפוס כולן מילות תפקוד: זה, לא, את, אני, של, על, מה, הוא, אז, אבל, גם, כל, יש, אתה, כן, מאוד, אנחנו, עם, לי, היה, הזה, או, אם, כי. זו רשימת העצירה היחידה שהשתמשנו בה, והיא כאן במלואה כדי שאפשר יהיה לשפוט אותה.

מה שמעניין הוא מה בא אחריהן. במקום 25 יושבת כאילו. הצירוף אנשים, שם העצם הראשון שאומר משהו על העולם, מגיע רק במקום 70. ישראל, במדינה שמדברת על עצמה בלי הפסקה, נמצאת במקום 135.

דירוג מילה מופעים אחוז מהפרקים שבהם מופיעה
1 זה 511,718 98.4%
2 לא 419,020 98.5%
3 את 416,902 98.9%
4 אני 316,363 96.4%
5 של 249,822 98.7%
25 כאילו 72,743 73.5%
54 בעצם 42,006 77.8%
70 אנשים 34,357 79.4%
81 אוקיי 30,015 64.9%
135 ישראל 16,054 40.8%
24 מילים מחזיקות את השפה: אחוז מהפרקים שבהם מופיעה
זה: 98.4% (1 דירוג)‏זה98.4%‏1 דירוגלא: 98.5% (2 דירוג)‏לא98.5%‏2 דירוגאת: 98.9% (3 דירוג)‏את98.9%‏3 דירוגאני: 96.4% (4 דירוג)‏אני96.4%‏4 דירוגשל: 98.7% (5 דירוג)‏של98.7%‏5 דירוגכאילו: 73.5% (25 דירוג)‏כאילו73.5%‏25 דירוגבעצם: 77.8% (54 דירוג)‏בעצם77.8%‏54 דירוגאנשים: 79.4% (70 דירוג)‏אנשים79.4%‏70 דירוגאוקיי: 64.9% (81 דירוג)‏אוקיי64.9%‏81 דירוגישראל: 40.8% (135 דירוג)‏ישראל40.8%‏135 דירוג

כאילו, ובעצם, ואה

כאילו על כל צורותיה מופיעה 79,241 פעמים, מילה אחת מכל 243. בעצם מופיעה 50,717 פעמים. הצירוף סוג של מופיע 4,948 פעמים ב-33.4 אחוז מהפרקים. אני חושב ש מופיע 17,478 פעמים, בדיוק בחצי מהפרקים בקורפוס.

קחו את החמישייה כאילו, בעצם, אה, אמ וסוג של ותקבלו 143,902 מופעים, 0.745 אחוז מהמילים. מילת מילוי אחת מכל 134 מילים.

המספר הזה נמוך מדי, ואנחנו יודעים למה. אה מופיעה 8,974 פעמים בלבד ואמ מופיעה 12 פעמים. שתים עשרה, בכל 19.3 מיליון המילים. אף אדם לא מדבר ככה. מנוע התמלול פשוט מוחק היסוסים קוליים כי הוא אומן על טקסט ערוך. כאילו ובעצם שורדות מפני שהן מילים לכל דבר עם אותיות משלהן, ואה ואמ נמחקות. כל מספר של מילות מילוי מתמלול אוטומטי הוא רצפה, לא תקרה.

מה שכן אפשר להשוות זה ז'אנר לז'אנר, כי הטיית המחיקה זהה בכולם.

ז'אנר iTunes פרקים כאילו לכל 1,000 מילים
True Crime 53 16.18
Comedy 117 10.52
TV & Film 95 9.17
Parenting 148 6.76
Relationships 191 6.55
History 160 1.73
Judaism 599 1.10
Medicine 56 0.86
Stories for Kids 98 0.49
כאילו, ובעצם, ואה: כאילו לכל 1,000 מילים
True Crime: 16.2 (53 פרקים)True Crime16.2‏53 פרקיםComedy: 10.5 (117 פרקים)Comedy10.5‏117 פרקיםTV & Film: 9.2 (95 פרקים)TV & Film9.2‏95 פרקיםParenting: 6.8 (148 פרקים)Parenting6.8‏148 פרקיםRelationships: 6.5 (191 פרקים)Relationships6.5‏191 פרקיםHistory: 1.7 (160 פרקים)History1.7‏160 פרקיםJudaism: 1.1 (599 פרקים)Judaism1.1‏599 פרקיםMedicine: 0.9 (56 פרקים)Medicine0.9‏56 פרקיםStories for Kids: 0.5 (98 פרקים)Stories for Kids0.5‏98 פרקים

פער של פי 33 בין הקצה העליון לתחתון, מוגבל לז'אנרים עם 40 פרקים לפחות. כאילו היא לא סימן לרישול. היא סימן לשיחה לא כתובה. איפה שיש תסריט, שיעור או הקראה לילדים, היא כמעט נעלמת.

אוקיי כן, בייסיקלי לא

אוקיי מופיעה 30,015 פעמים ב-5,234 פרקים, שני שלישים מהקורפוס. זו המילה הלועזית היחידה שנכנסה לגמרי לעברית מדוברת.

שאר המילון הסטריאוטיפי כמעט לא קיים. בייסיקלי: אפס מופעים. אקזקטלי: אפס. מיטינג, פרוצס, אינסייט, קליינט: אפס כל אחד. ליטרלי מופיעה 152 פעמים. אקטואלי על צורותיה 259 פעמים. מה שכן חי הוא אוצר מילים עסקי ורגשי: סיטואציה על צורותיה 3,420 מופעים, סטארט-אפ 1,540, רלוונטי 1,735, וואטסאפ 1,122, סטרס 782, ביזנס 580, טרנד 579, פידבק 487. לצידם עומדות מילות שאילה שאינן אנגלית בכלל: יאללה 4,284, וואלה 2,311, תכלס 1,177.

אותיות לטיניות מופיעות בגוף הטקסט 274,277 פעמים, אבל 72.4 אחוז מהן מרוכזות ב-83 קבצים בלבד, שהם פרקים שנאמרו באנגלית מלכתחילה ורשומים תחת שם עברי. ב-7,985 הקבצים העבריים באמת התדירות יורדת ל-3.96 אסימונים לטיניים לכל 1,000 מילים. 3,398 קבצים לא מכילים ולו אות לטינית אחת. האסימון הלטיני הנפוץ ביותר שאינו מילת תפקוד אנגלית הוא ai, עם 4,224 מופעים.

סייג חשוב: כשדובר עברית זורק מילה אנגלית באמצע משפט, המנוע כותב אותה באותיות עבריות. ספירת האותיות הלטיניות מודדת מעבר שפה מלא, לא ערבוב.

המשפטים קצרים, וחלקם חסרים

הקורפוס מחולק ל-4,156,612 מקטעי תמלול, ממוצע של 4.65 מילים למקטע וחציון של 4. לפי סימני פיסוק יוצאים 1,093,937 משפטים בממוצע 17.66 מילים, אבל הפיסוק הוא של המכונה ולא של הדובר, ולכן זה מדד לאופן שבו המנוע חותך ולא לאופן שבו אנשים נושמים.

וכאן הבעיה החמורה ביותר בנתונים. חיברנו 7,756 מהתמלולים לאורך האודיו האמיתי שלהם והוצאנו 59.0 מילים לדקה. זה בלתי אפשרי. פירוק לפי אורך הפרק מסביר למה: פרקים מתחת ל-10 דקות מניבים 133.0 מילים לדקה, קצב דיבור סביר. פרקים של 60 עד 70 דקות מניבים 44.0. פרקים של שעתיים מניבים 20.4. מספר המילים מתייצב סביב 2,500 עד 3,500 בלי קשר לאורך.

המשמעות ברורה. חלק ניכר מהפרקים הארוכים תומלל חלקית, כי הצנרת הישנה חתכה את האודיו והחדשה לא. 19.3 מיליון המילים הן מה שהמכונה הספיקה לכתוב, לא מה שנאמר.

מה שלא ידוע

אנחנו לא יודעים כמה מילים באמת נאמרו ב-5,257 השעות. אנחנו יודעים שזה יותר מ-19.3 מיליון, ולא בכמה.

אנחנו לא יודעים את שיעור מילות המילוי האמיתי, כי המנוע מוחק היסוסים לפני שאנחנו רואים אותם. ההשוואה בין ז'אנרים תקפה, המספר המוחלט לא.

אנחנו לא יודעים מי דיבר. לתמלולים אין תיוג דוברים, ולכן אי אפשר להפריד מנחה מאורח, לא לפי מגדר ולא לפי תפקיד. אורך תור דיבור אינו ניתן למדידה כאן.

אנחנו לא יודעים כמה שמות פרטיים נכתבו שגוי. מנועי תמלול נכשלים בשמות עבריים באופן שיטתי, ולכן לא נבנתה כאן שום סטטיסטיקה על שמות אנשים.

ולבסוף, 8,068 פרקים הם דגימה של 1,718 תוכניות מתוך 3,300 באינדקס, והדגימה מוטה לכיוון פרקים אחרונים ולכיוון תוכניות פעילות. זו לא כל העברית המדוברת. זו הכמות הגדולה ביותר ממנה שמישהו ספר עד היום.

הכתבה נכתבה בסיוע בינה מלאכותית על בסיס ניתוח הקורפוס של פודקאסט·ישראל. כל הנתונים חושבו מהאינדקס החי ב-31 ביולי 2026. על המתודולוגיה: pod-il.co.il/methodology

הארכיון שלכם הוא אודיו מת שגוגל ו-ChatGPT לא מוצאים

כל פרק יכול להיות מאמר עברי שמדורג בגוגל ומצוטט על ידי מנועי הבינה המלאכותית. זה בדיוק מה שעשינו כאן, אוטומטית, על הקורפוס כולו.

רוצה מגזין כזה לפודקאסט שלך

השאר תגובה

הכנס תגובה
הכנס את שמך כאן