![[151] עקבות של רעשי תיוג עם ד״ר שמואל חיון](/_next/image?url=https%3A%2F%2Fd3t3ozftmdmh3i.cloudfront.net%2Fstaging%2Fpodcast_uploaded_episode%2F44943178%2F44943178-1774870718731-7a1a938e30e0f.jpg&w=384&q=75&dpl=dpl_De19gkM5g3qdwaWbojgZwwVbwnzp)
[151] עקבות של רעשי תיוג עם ד״ר שמואל חיון
עודכן: מאת צוות פודקאסט·ישראל
/ הפרק במספרים
| פורסם | 30 במרץ 2026 |
|---|---|
| אורך | 36 דק׳ (ארוך ב-29% מהממוצע בתוכנית) |
| הנושא המרכזי | איכות נתונים בלמידה עמוקה |
| קטגוריה | הייטק וסטארטאפים |
על מה הפרק?
שיחה על חשיבות איכות הנתונים בלמידת מכונה ודרכים לזיהוי ותיקון שגיאות תיוג בדאטה-סטים לאימון מודלים.
הפרק מארח את דוקטור שמואל חיון, חוקר בכיר בחברת אירונדו, לשיחה על עולם איכות הנתונים בהקשר של למידה עמוקה. הפרק מפרט את הבעיות המרכזיות כמו שגיאות תיוג ואנומליות, ומסביר מדוע זיהוי נתונים איכותיים קריטי לביצועי המודל. המאזינים יזכו להכיר שיטות שונות להתמודדות עם האתגרים הללו, החל מבדיקה ידנית ועד לשיטות אוטומטיות מבוססות מודלים והטמעות.
/ תובנות מרכזיות
- איכות נתונים אינה רק ניקיון בסיסי, אלא אסטרטגיה לסינון נתונים משמעותיים לצורך התייעלות באימון מודלים.
- בעיית שגיאות התיוג מובילה ישירות לירידה בביצועי המודל ולכן מהווה צוואר בקבוק משמעותי.
- המעבר מאלגוריתמיקה קלאסית ללמידה עמוקה מחייב שינוי תפיסה באופן שבו אנחנו מנתחים ומתקפים את הדאטה.
- שיטות אוטומטיות לזיהוי שגיאות תיוג נשענות לעיתים על הנחות מקדימות כמו גישה למודל מאומן היטב, מה שלא תמיד קיים בדאטה סגור.
כיצד מודל למידה עמוקה שסובל מ-overfitting על דוגמאות שגויות יוכל לזהות בעצמו את השגיאות הללו?
ניתוח מאת מערכת פודקאסט·ישראל, מבוסס תמלול אוטומטי של הפרק. על המתודולוגיה והמגבלות
/ שאלות נפוצות על הפרק
- על מה הפרק הזה?
- הפרק מארח את דוקטור שמואל חיון, חוקר בכיר בחברת אירונדו, לשיחה על עולם איכות הנתונים בהקשר של למידה עמוקה. הפרק מפרט את הבעיות המרכזיות כמו שגיאות תיוג ואנומליות, ומסביר מדוע זיהוי נתונים איכותיים קריטי לביצועי המודל. המאזינים יזכו להכיר שיטות שונות להתמודדות עם האתגרים הללו, החל מבדיקה ידנית ועד לשיטות אוטומטיות מבוססות מודלים והטמעות.
- מהן התובנות המרכזיות מהפרק?
- איכות נתונים אינה רק ניקיון בסיסי, אלא אסטרטגיה לסינון נתונים משמעותיים לצורך התייעלות באימון מודלים. · בעיית שגיאות התיוג מובילה ישירות לירידה בביצועי המודל ולכן מהווה צוואר בקבוק משמעותי. · המעבר מאלגוריתמיקה קלאסית ללמידה עמוקה מחייב שינוי תפיסה באופן שבו אנחנו מנתחים ומתקפים את הדאטה. · שיטות אוטומטיות לזיהוי שגיאות תיוג נשענות לעיתים על הנחות מקדימות כמו גישה למודל מאומן היטב, מה שלא תמיד קיים בדאטה סגור.
מתיאור הפרק
השבוע באקספליינבל אנחנו עוברים למתכונת רימוט ומארחים את ד״ר שמואל חיון, חוקר AI בכיר בהירונדו, שיספר לנו על העקבות שתיוג לא נכון משאיר לנו בזמן אימון המודל. הבנו איך טעות סיווג בהקלטה עם קשר טמפורלי קשורה לקלסיפיקציה של חתולים, ומתי סטטיסטיקות על פיצ׳רים כבר לא יכולות לעזור לנו במציאת טעויות סיווג (רמז: תמונות). העמקנו בהשפעה של דוגמא עם סיווג לא-נכון על loss של דוגמא אחרת, ואיך מודאליות שונה תשתמש אחרת באותה ליבה אלגוריתמית למציאת הרעשים. המאמרים שהוזכרו בפרק: שערוך יעיל של data influence למציאת שגיאות תיוג סקירת מגוון שיטות לחישוב מקורב של data influence 00:00 היי שמואל, חוקר AI בכיר בהירונד
/ עוד פרקים על בינה מלאכותית
- 001 - פודקאסט הצומתהצומת | יומינט ואוסינט: ארגז הכלים של היזם החדש - הודיה בן חמוהודיה בן חמו, בת 24, מנהלת סוכנות שיווק ומיזם הדרכה, מספרת איך תואר שהתחילה בגיל 16 ושבת ששמרה לבד מגיל 6 בנו לה משמעת של יזמית.
- 15-מיליון15-מיליוןפרק הכנה ראשון שמפרק את חוקי משחק הפנטזי של המונדיאל ואת השאלה האמיתית - מתי לוותר על הכוכב הגדול לטובת מיסמאצ' זול.
- 8-דקות-מודעות-קבלית-עם-מאיר-ישורוןפרק 1365: עולם מושלםשיעור בוקר קבלי על למה גם המחלות והרוע לא מיותרים בבריאה, ולמה מה שנראה לנו כחושך הוא בעצם אור שאין לנו עדיין כלים לראות אותו.
- ai-today-בינה-מלאכותיתפרק 1 | שגשוג האנושות או עתיד אכזרשיחה עם חוקר בינה מלאכותית ותיק על הדרך מהטכניון של שנות ה-90 ועד מכונות שכבר יודעות לנחש על מה חשבת - ועל מה חלמת.