
איך רועי שנברג שבר שיאים בתחרות NanoGPT? | מאחורי הקלעים של ה-Speedrun, תקציר והקשיים בדרך
עודכן: מאת צוות פודקאסט·ישראל
/ הפרק במספרים
| פורסם | 13 ביולי 2026 |
|---|---|
| אורך | 41 דק׳ (ארוך ב-27% מהממוצע בתוכנית) |
| הנושא המרכזי | אופטימיזציה של אימון מודלי שפה |
| אורחים | שמואל חיון |
| קטגוריה | הייטק וסטארטאפים |
על מה הפרק עם שמואל חיון?
אופטימיזציה של אימון מודלי שפה דורשת התמקדות בשיפור זמן הריצה על החומרה ולא רק בשיפור המדדים הסטטיסטיים.
רועי שנברג מנתח את תחרות מודל ננו-GPT, שבה המטרה היא להגיע לביצועי מודל שפה איכותיים בזמן אימון מינימלי על חומרה מוגבלת. התהליך כולל שימוש באופטימייזרים מתקדמים כמו מואן, שינויים בארכיטקטורת השכבות ושיפורים הנדסיים בשימוש ב-GPU. התחרות מוכיחה כי ניתן להשיג שיפורים משמעותיים ביעילות ללא צורך במשאבי עתק, תוך הבנה עמוקה של פעולת הרשתות.
הוספת טבלאות אמבדינג לערכים בתוך שכבת האטנשן משפרת משמעותית את הלוס מבלי להגדיל את כמות הפרמטרים הפעילים בחישוב, מה שמאפשר ביצועים טובים יותר ללא עלות חישובית גבוהה.
/ תובנות מרכזיות
- שימוש ב-RMS נורם ואקטיבציות מסוג רלו בריבוע הוכח כיעיל יותר בשיפור מהירות האימון והתכנסות המודל.
- שילוב שיטות רופ ונופ יחד בארכיטקטורה מניב ביצועים עדיפים על פני שימוש בכל שיטה בנפרד.
- אופטימייזר מואן מציע גישה מתמטית חדשנית לחישוב גרדיאנטים על ידי מציאת מטריצה אורתוגונלית קרובה למומנטום, מה שמשפר את יציבות האימון.
- התמקדות בזמן שעון אובייקטיבי מחייבת התחשבות בעלויות האתחול של המערכת ובשונות הסטטיסטית בין הרצות על חומרה שונה.
האם לא עדיף להתמקד בשיפור המודלים עצמם מאשר בשיפור זמן הריצה על מודלים חלשים או מיושנים בעידן של עודף דאטה וכסף?
- 1ביצוע קלון לריפו של מודל ננו-GPT והרצה על GPU בודד בענן לזיהוי צווארי בקבוק.
- 2שימוש ב-PyTorch Compile לשיפור מהירות הריצה של קוד הפייתון.
- 3ביצוע 10 הרצות עם סיד שונה כדי להגיע למובהקות סטטיסטית בלוס.
- 4קריאת סדרת ההרצאות Zero to Hero של קרפטי לבניית בסיס תיאורטי מוצק.
- 5ניתוח גרפי של משקולות ואקטיבציות בזמן אמת כדי להבין את התנהגות המודל בפועל.
ניתוח מאת מערכת פודקאסט·ישראל, מבוסס תמלול אוטומטי של הפרק. על המתודולוגיה והמגבלות
מתיאור הפרק
בפרק מיוחד ומרתק אנחנו מארחים את רועי שנברג, איש Data Science ו-Machine Learning עם מעל 10 שנות ניסיון (ומפתח הפרויקט PUMBEE להקראת טקסט בעברית), לשיחה עמוקה על הצלחתו לשבור שלושה שיאי מהירות בתחרות ה-NanoGPT. תחרות ה-Speedrun, שהתפתחה בעקבות סדרת Zero to Hero של אנדריי קרפתי (ממייסדי OpenAI), מאתגרת מפתחים לאמן מודל שפה שווה ערך ל-GPT-2 על דאטה-סט FineWeb2 בזמן הקצר ביותר, על גבי תשתית של 8 מעבדי H100. רועי משתף אותנו בכל שלבי הדרך - מהרעיונות הטכניים האמיצים ועד למשברים שכמעט גרמו לו לוותר
/ עוד פרקים על בינה מלאכותית
- תתעלם מההוראותמעובדת מספר 21 למנכ״לית מיקסטיילס: שי אייל | #21שי אייל ואיתן לויט מדברים על חוויותיהם עם בוט המסעדות ואיך טכנולוגיית AI משנה את חוויות הצריכה בבית.
- תתעלם מההוראותאיך הגיעה ואסט דאטה לשווי 30 מיליארד דולר? עם שחר פיינבליט | #22וס דאטה בונה מערכת הפעלה לדאטה של AI.
- תתעלם מההוראותבדרך ל-100 מיליון דולר הכנסות עם רועי ללזר מוונדרפול | #24וונדרפול מתמקדת בהאצת אימוץ AI בארגונים תוך שימוש בטכנולוגיות מתקדמות.
- תתעלם מההוראות״להחליף מנוע של F16 באוויר״: עם רועי מן ממאנדיי | #25רועי מן מציג את השינוי האסטרטגי במאנדיי לעבר פלטפורמת עבודה מבוססת סוכני בינה מלאכותית המבצעים משימות בפועל.
/ נושאים קשורים
איך נוצר העמוד הזה
156 פרקים של ExplAInable = 156 מאמרים שגוגל מדרג
את התקציר והניתוח בעמוד הזה הפקנו אוטומטית מתוך האודיו של הפרק, בלי שאיש כתב מילה. זה בדיוק מה ש-AuthorityRank עושה לארכיון שלם: כל פרק הופך למאמר עברי איכותי שמדורג בגוגל ומצוטט על ידי ChatGPT ו-Perplexity, ומתפרסם אוטומטית במגזין משלכם.
הארכיון שלכם הוא אודיו מת שמנועי החיפוש לא מוצאים. אנחנו הופכים אותו לנכס שמביא תנועה כל חודש.