
Agentic AI at scale: Interview with Benjamin Mayr, Vice President, Head of Architecture at NiCE
עודכן: מאת צוות פודקאסט·ישראל
/ הפרק במספרים
| פורסם | 8 ביולי 2026 |
|---|---|
| אורך | 42 דק׳ (ארוך ב-20% מהממוצע בתוכנית) |
| הנושא המרכזי | בניית סוכני AI לשירות לקוחות בקנה מידה |
| קטגוריה | הייטק וסטארטאפים |
על מה הפרק?
המייסד של Cognigy מסביר למה ה-LLM הוא דווקא החלק הקל, ולמה העתיד הוא סוכני AI שמדברים עם סוכני AI.
מפתיע לגלות ש-Cognigy התחילה כרעיון של דובי מדבר לילדים, ורק אז התגלגלה לשירות לקוחות בקנה מידה עצום שנמכר ל-NICE בכמיליארד דולר. בנג'מין מערער על ההנחה שה-LLM הוא הלב של המערכת, וטוען שה'רתמה' סביבו - ניתוב בין מודלים, גיבוי כשמפתח API מתחלף, בידוד קוד של כל לקוח - היא מה שבאמת קובע אם המערכת תחזיק בעומס. המתח האמיתי הוא הפער בין הדמו שמריצים על המודל היקר והמרשים ביותר, לבין חשבון ה-ROI שמחזיר אותך למודל זול פי חמישה. והשאלה שנשארת פתוחה: האם הארגונים ערוכים לרגע שבו הלקוחות שלהם כבר לא בני אדם אלא סוכני AI.
בעוד כמה שנים הלקוחות של מוקדי השירות לא יהיו בני אדם אלא סוכני AI אישיים שפועלים בשם המשתמשים, מה שיכפיל את נפח הפניות פי עשרות ואף מאה, ובמקום אתרים חברות יפרסמו את השירותים שלהן כסוכנים שסוכנים אחרים ידברו איתם.
/ תובנות מרכזיות
- ה'רתמה' סביב המודל חשובה יותר מהמודל עצמו: אחרי עידן שבו הכל רץ מקומית ועמידות לא הייתה בעיה, התלות ב-LLM חיצוני החזירה את שאלת הזמינות לשולחן.
- ה-LLM Gateway מנתב קריאות בין כמה נקודות הרצה במדינות שונות לפי זמן תגובה, ואם מפתח API מתחלף פתאום או נכשל הוא עובר אוטומטית למודל אחר מהמאגר כדי שהקריאה תצליח.
- מהפך בסדר העבודה: במקום להתחיל מבנייה, מתחילים מהדאטה הקיים של המוקד. כמו בלמידת מכונה, חלק מהשיחות מייצרות את הסוכנים וחלק אחר מייצר סימולציות לבדיקה.
- הסימולטור הוא גם כלי עלות וגם כלי אבטחה: מריצים אלפי תרחישי תקיפה כדי לתמחר כמה 'יעלה' ניצול לרעה, ומכל שיחה אמיתית שסומנה כבעייתית נוצר אוטומטית תרחיש בדיקה חדש.
השאלה הקשה של המנחה - איזו טכנולוגיה הפכה את זה לאפשרי היום ולא לפני שנתיים - שקיבלה תשובה מפתיעה: זה היה אפשרי גם לפני חמש שנים במערכות מבוססות חוקים, אבל ה-LLM הוא שהפך את זה לעמיד, כי הוא מבין גם 'בראבו בראבו דאבל צ'רלי טריפל איקס' כקוד הזמנה.
ניתוח מאת מערכת פודקאסט·ישראל, מבוסס תמלול אוטומטי של הפרק. על המתודולוגיה והמגבלות
/ שאלות נפוצות על הפרק
- על מה הפרק הזה?
- מפתיע לגלות ש-Cognigy התחילה כרעיון של דובי מדבר לילדים, ורק אז התגלגלה לשירות לקוחות בקנה מידה עצום שנמכר ל-NICE בכמיליארד דולר. בנג'מין מערער על ההנחה שה-LLM הוא הלב של המערכת, וטוען שה'רתמה' סביבו - ניתוב בין מודלים, גיבוי כשמפתח API מתחלף, בידוד קוד של כל לקוח - היא מה שבאמת קובע אם המערכת תחזיק בעומס. המתח האמיתי הוא הפער בין הדמו שמריצים על המודל היקר והמרשים ביותר, לבין חשבון ה-ROI שמחזיר אותך למודל זול פי חמישה. והשאלה שנשארת פתוחה: האם הארגונים ערוכים לרגע שבו הלקוחות שלהם כבר לא בני אדם אלא סוכני AI.
- מהן התובנות המרכזיות מהפרק?
- ה'רתמה' סביב המודל חשובה יותר מהמודל עצמו: אחרי עידן שבו הכל רץ מקומית ועמידות לא הייתה בעיה, התלות ב-LLM חיצוני החזירה את שאלת הזמינות לשולחן. · ה-LLM Gateway מנתב קריאות בין כמה נקודות הרצה במדינות שונות לפי זמן תגובה, ואם מפתח API מתחלף פתאום או נכשל הוא עובר אוטומטית למודל אחר מהמאגר כדי שהקריאה תצליח. · מהפך בסדר העבודה: במקום להתחיל מבנייה, מתחילים מהדאטה הקיים של המוקד. כמו בלמידת מכונה, חלק מהשיחות מייצרות את הסוכנים וחלק אחר מייצר סימולציות לבדיקה. · הסימולטור הוא גם כלי עלות וגם כלי אבטחה: מריצים אלפי תרחישי תקיפה כדי לתמחר כמה 'יעלה' ניצול לרעה, ומכל שיחה אמיתית שסומנה כבעייתית נוצר אוטומטית תרחיש בדיקה חדש.
מתיאור הפרק
In this episode I had the honor to interview Benjamin Mayr, Vice President, Head of Architecture at NiCE Cognigy. Benjamin took me deep into what it really takes to run enterprise-grade conversational and agentic AI at scale. We talked about the "harness" around the model - the layer that turns a raw LLM into a reliable agent in a live contact center. He also broke down the LLM Gateway, which pools and load-balances across many model endpoints to keep everything fast and always-on. We also explored why picking the right model for the right job beats raw reasoning power, and looked ahead to a f