![[151] עקבות של רעשי תיוג עם ד״ר שמואל חיון](/_next/image?url=https%3A%2F%2Fd3t3ozftmdmh3i.cloudfront.net%2Fstaging%2Fpodcast_uploaded_episode%2F44943178%2F44943178-1774870718731-7a1a938e30e0f.jpg&w=384&q=75&dpl=dpl_6tMfKD1n9FhZvjqugUdV3ZNgVYCv)
[151] עקבות של רעשי תיוג עם ד״ר שמואל חיון
עודכן: מאת צוות פודקאסט·ישראל
/ הפרק במספרים
| פורסם | 30 במרץ 2026 |
|---|---|
| אורך | 36 דק׳ (ארוך ב-13% מהממוצע בתוכנית) |
| הנושא המרכזי | איכות נתונים בלמידה עמוקה |
| קטגוריה | הייטק וסטארטאפים |
על מה הפרק?
שיחה על חשיבות איכות הנתונים בלמידת מכונה ודרכים לזיהוי ותיקון שגיאות תיוג בדאטה-סטים לאימון מודלים.
הפרק מארח את דוקטור שמואל חיון, חוקר בכיר בחברת אירונדו, לשיחה על עולם איכות הנתונים בהקשר של למידה עמוקה. הפרק מפרט את הבעיות המרכזיות כמו שגיאות תיוג ואנומליות, ומסביר מדוע זיהוי נתונים איכותיים קריטי לביצועי המודל. המאזינים יזכו להכיר שיטות שונות להתמודדות עם האתגרים הללו, החל מבדיקה ידנית ועד לשיטות אוטומטיות מבוססות מודלים והטמעות.
/ תובנות מרכזיות
- איכות נתונים אינה רק ניקיון בסיסי, אלא אסטרטגיה לסינון נתונים משמעותיים לצורך התייעלות באימון מודלים.
- בעיית שגיאות התיוג מובילה ישירות לירידה בביצועי המודל ולכן מהווה צוואר בקבוק משמעותי.
- המעבר מאלגוריתמיקה קלאסית ללמידה עמוקה מחייב שינוי תפיסה באופן שבו אנחנו מנתחים ומתקפים את הדאטה.
- שיטות אוטומטיות לזיהוי שגיאות תיוג נשענות לעיתים על הנחות מקדימות כמו גישה למודל מאומן היטב, מה שלא תמיד קיים בדאטה סגור.
כיצד מודל למידה עמוקה שסובל מ-overfitting על דוגמאות שגויות יוכל לזהות בעצמו את השגיאות הללו?
ניתוח מאת מערכת פודקאסט·ישראל, מבוסס תמלול אוטומטי של הפרק. על המתודולוגיה והמגבלות
מתיאור הפרק
השבוע באקספליינבל אנחנו עוברים למתכונת רימוט ומארחים את ד״ר שמואל חיון, חוקר AI בכיר בהירונדו, שיספר לנו על העקבות שתיוג לא נכון משאיר לנו בזמן אימון המודל. הבנו איך טעות סיווג בהקלטה עם קשר טמפורלי קשורה לקלסיפיקציה של חתולים, ומתי סטטיסטיקות על פיצ׳רים כבר לא יכולות לעזור לנו במציאת טעויות סיווג (רמז: תמונות). העמקנו בהשפעה של דוגמא עם סיווג לא-נכון על loss של דוגמא אחרת, ואיך מודאליות שונה תשתמש אחרת באותה ליבה אלגוריתמית למציאת הרעשים. המאמרים שהוזכרו בפרק: שערוך יעיל של data influence למציאת שגיאות תיוג סקירת מגוון שיטות לחישוב מקורב של data influence 00:00 היי שמואל, חוקר AI בכיר בהירונד
/ עוד פרקים על בינה מלאכותית
- תתעלם מההוראותמעובדת מספר 21 למנכ״לית מיקסטיילס: שי אייל | #21שי אייל ואיתן לויט מדברים על חוויותיהם עם בוט המסעדות ואיך טכנולוגיית AI משנה את חוויות הצריכה בבית.
- תתעלם מההוראותאיך הגיעה ואסט דאטה לשווי 30 מיליארד דולר? עם שחר פיינבליט | #22וס דאטה בונה מערכת הפעלה לדאטה של AI.
- תתעלם מההוראותבדרך ל-100 מיליון דולר הכנסות עם רועי ללזר מוונדרפול | #24וונדרפול מתמקדת בהאצת אימוץ AI בארגונים תוך שימוש בטכנולוגיות מתקדמות.
- תתעלם מההוראות״להחליף מנוע של F16 באוויר״: עם רועי מן ממאנדיי | #25רועי מן מציג את השינוי האסטרטגי במאנדיי לעבר פלטפורמת עבודה מבוססת סוכני בינה מלאכותית המבצעים משימות בפועל.
/ נושאים קשורים
איך נוצר העמוד הזה
156 פרקים של ExplAInable = 156 מאמרים שגוגל מדרג
את התקציר והניתוח בעמוד הזה הפקנו אוטומטית מתוך האודיו של הפרק, בלי שאיש כתב מילה. זה בדיוק מה ש-AuthorityRank עושה לארכיון שלם: כל פרק הופך למאמר עברי איכותי שמדורג בגוגל ומצוטט על ידי ChatGPT ו-Perplexity, ומתפרסם אוטומטית במגזין משלכם.
הארכיון שלכם הוא אודיו מת שמנועי החיפוש לא מוצאים. אנחנו הופכים אותו לנכס שמביא תנועה כל חודש.