איך AI רואה עיר שלמה: מאחורי הקלעים של פתרונות AI בסקייל

אלפי מצלמות בעיר, שניים-שלושה אנשים בחדר הבקרה. ככה זה נראה לפני AI. מדריך מלא ממפגש 31 של מועדון AI Master עם גלית לוין, מנהלת בכירה בדלויט: איך עובדות ערים חכמות מאחורי הקלעים, מתי בוחרים ענן ומתי Edge, איך בונים אמון בסוכני AI פיננסיים, ולמה Physical AI הוא התחנה הבאה.

איך AI רואה עיר שלמה: מאחורי הקלעים של פתרונות AI בסקייל

כשאנחנו חושבים על AI, קל לדמיין שהוא פותר הכל בקליק. במציאות, בין רעיון לבין מערכת שעובדת באמת יש דרך שלמה: לפרק את הבעיה, להבין את המגבלות של הלקוח, לבחור ארכיטקטורה, ולפתור אלף בעיות קטנות שאף אחד לא חשב עליהן מראש.

המדריך הזה הוא הסיכום הכתוב של מפגש 31 במועדון AI Master, עם גלית לוין, מנהלת בכירה בדלויט וחלק מה-Alliance של דלויט ו-NVIDIA. גלית מגיעה עם כ-15 שנות ניסיון ב-Deep Learning, אחרי כעשור באינטל וכשבע שנים במובילאיי בפיתוח רכבים אוטונומיים, עם פטנטים בתחום ה-AI Vision. במפגש היא פתחה את מאחורי הקלעים: איך נראים פרויקטים של AI בסקייל של ערים שלמות וארגוני ענק.

הקבוצה שגלית מובילה בדלויט עובדת בשני אפיקים: עולמות ה-Vision (ניתוח תמונה ווידאו) והעולמות האג'נטיים (סוכני AI שמחוברים לדאטה הארגוני). ההפרדה היא בעיקר קונספטואלית, כי בפועל גם מערכות אג'נטיות צריכות להבין דאטה ויזואלי כמו גרפים ומסמכים.

ערים חכמות: אלפי מצלמות, מוח אחד

אחד הפרויקטים המרכזיים של הקבוצה הוא CityShield, מערכת עיר חכמה שפותחה בדלויט. המערכת מתחברת לאלפי מצלמות שכבר פרוסות ברחבי העיר, גם בזמן אמת וגם להקלטות עבר, לפי מיקום, מספר מצלמה, תאריך ושעה.

למה זה נחוץ? כי היום המצב ברוב הערים נראה ככה: חדר בקרה עם מסכים מסביב, שניים-שלושה אנשים שאמורים להסתכל בו-זמנית על אלפי מצלמות, ולנחש אם קורה משהו. זה פשוט לא סקיילבילי. CityShield הופכת את זה: המערכת צופה בכל המצלמות כל הזמן, מדרגת כל סצנה לפי קריטריונים שהעירייה הגדירה, ומדליקה התראות רק כשצריך.

מה המערכת מזהה בפועל

  • ניקיון ותחזוקה · זיהוי הצטברות זבל, מפגעים על המדרכה או הכביש (אפילו ענף עץ שנפל), והתראה לטיפול מיידי

  • התקהלויות · זיהוי צפיפות קהל שיכולה להוביל לאלימות, כייסות או עומס על התחבורה

  • גרפיטי וונדליזם · זיהוי בזמן אמת, כשבערים באירופה הקנס על גרפיטי מגיע ל-3,000 עד 5,000 דולר

  • ניהול תנועה · בקרת רמזורים חכמה לפי עומס בפועל במקום זמנים קבועים מראש

תובנה מעניינת מהשטח: תיירות היא לא רק דבר חיובי לעיר. ערים מרכזיות באירופה פנו לדלויט דווקא בגלל שהתיירות מביאה איתה כייסות, התקהלויות, כמויות זבל גדולות וגרפיטי. עיר חכמה היא קודם כל תשובה לבעיות האלה.

ענן או Edge: ההחלטה שמעצבת את כל הפרויקט

אחת ההחלטות הכי חשובות בפרויקט AI היא לא איזה מודל לבחור, אלא איפה הוא ירוץ. וזו החלטה שנגזרת מהמציאות של הלקוח, לא מהטכנולוגיה.

עיר שיש בה Wi-Fi ואינטרנט בכל מקום יכולה לחבר את המצלמות לענן, ושם לעבוד עם מודלים גדולים וחכמים, כולל VLM ומודלי שפה. אבל יש ערים שאין בהן תשתית כזאת בכלל. שם כל החישוב חייב לקרות על המצלמה עצמה: שמים בתוכה צ'יפ קטן של NVIDIA כמו Jetson בעלות של מאות דולרים, ומריצים עליו רשתות Deep Learning קטנות שאומנו לבעיה ספציפית והוקטנו כדי להיכנס לחומרה.

זה בדיוק ההבדל בין דמו לפרודקשן: הפתרון הנכון הוא לא המודל הכי חזק, אלא המודל שעומד בתקציב, בחומרה וב-Latency של הלקוח.

פרטיות היא לא כוכבית בסוף, היא תנאי כניסה. דאטה של מצלמות עירוניות הוא מידע רגיש: העיריות לא חולקות אותו החוצה, גם לא עם דלויט עצמה. הצוות שולח אנשים לשבת פיזית אצל הלקוח, להתקין ולבדוק הכל שם. כל עבודה על הדאטה מחייבת טשטוש פנים, והמודלים נבדקים מול התקנים והחוקים שהעירייה מחויבת להם.

כשהלקוח מבקש דבר אחד וצריך דבר אחר

הלקוח ביקש "לספור אנשים במצלמה". אבל ספירה לבד היא נתון חסר משמעות: 300 איש יכולים להיות מפוזרים על רחוב ארוך בלי שום בעיה, או דחוסים בפינה אחת ברמת סיכון גבוהה. הצוות של גלית חזר ללקוח ושינה יחד איתו את הגדרת הפרויקט: לא Crowd Count אלא Density Estimation, מדד צפיפות שאומר לא רק כמה אנשים יש, אלא כמה הם צפופים.

זה אחד הלקחים החשובים במפגש: הרבה פעמים הלקוח עצמו לא יודע עד הסוף מה הוא צריך. חלק מהעבודה הוא לחדד יחד איתו את הבעיה האמיתית לפני שכותבים שורת קוד אחת.

הבעיות שפוגשים רק בפרודקשן

  • תאורה ומזג אוויר · רחובות חשוכים בלילה, גשם ושלג שמסתירים את התמונה

  • לבוש חורפי · אנשים מכוסים בכובעים ומעילים, כשרוב הפנים והגוף מוסתרים

  • השתקפויות בחלונות ראווה · המערכת יכולה לספור את אותו אדם פעמיים, פעם אמיתי ופעם בהשתקפות

  • הסתרות (Occlusions) · תינוק בעגלה שרואים ממנו רק חתיכת פנים, אדם מאחורי עץ, יד או מצח שמציצים מתוך קהל צפוף

  • הבדלים בין ערים · עיר אירופאית נראית אחרת מעיר ישראלית, והתרבות המקומית משנה את איך שהדאטה נראה

איך גורמים ללקוח לסמוך על המערכת? אי אפשר לצפות ממנו לספור אלפי אנשים בעיניים כדי לוודא שהמספר נכון. הפתרון: המערכת מסמנת נקודה אדומה על כל אדם שהיא מזהה, כך שאפשר לראות בדיוק את מי היא ספרה, כולל המקרים הקשים כמו תינוק מכוסה בעגלה. שקיפות היא שבונה אמון.

מהתראות לתחזיות: הדאטה שנאסף שווה כסף

מעבר לזמן אמת, האלרטים שהמערכת מייצרת נאספים לאורך חודשים, ומודלים עוברים עליהם ומחפשים טרנדים: באילו ימים, שעות ומקומות חוזרות בעיות ניקיון, התקהלויות או עומסי תנועה.

ככה עוברים מתגובה לחיזוי: העירייה יודעת מראש מתי לתגבר שוטרים, מתי לתגבר תחבורה, ומתי לתגבר איסוף זבל. עיריות שמוציאות מיליונים בשנה על פינוי אשפה מקבלות ראוטינג חכם של מסלולי איסוף, ופיקוח אמיתי על ספקים: המערכת מראה שחור על גבי לבן אם רמת הניקיון באמת עלתה אחרי שהקבלן עבר.

Zora: סוכני AI שעובדים בארגונים הכי גדולים בעולם

האפיק השני של הקבוצה הוא Zora, משפחת סוכני ה-AI שהיא מוצר הדגל של דלויט העולמית, עם פיתוח שמובל ברובו מישראל. מה זה סוכן AI? בהגדרה של גלית: AI חכם שיש לו ידיים. כמו תמנון שכל זרוע שלו היא יכולת נוספת: גישה למחשבון, לקבצים, למערכות הארגון. ככל שנותנים לו יותר זרועות, הוא יכול לעשות יותר, וצריך גם יותר בקרה.

הרעיון של Zora הוא לחבר שני דברים שיש לדלויט: מומחי תוכן בפיננסים, ביטוח, מכירות ו-HR, ומהנדסי AI. הידע של המומחים מוזן לתוך הסוכנים, וכך נוצר סוכן שמכיר את התחום לעומק, לא רק את האינטרנט.

המערכות האלה כבר בפרודקשן אצל לקוחות גלובליים, עם אלפי כניסות ביום. HP, אחד הלקוחות הגדולים, הצהירה ש-40% מהעבודה הידנית שצוותי הפיננסים עשו בעבר נעשית היום בשניות על ידי המערכת האג'נטית.

ארבע שכבות של ערך: משאלה-תשובה ועד המלצות

  1. שכבה 1 · שאלה ותשובה: "מה היו ההכנסות שלי החודש?" והסוכן שולף מכל הדאטה הארגוני

  2. שכבה 2 · אנליזה וסיבת שורש: לא רק כמה, אלא למה. איזה אזור ירד, איזה שוק הפתיע, איך המטבע השפיע

  3. שכבה 3 · תחזית: Forecast להכנסות על סמך הדאטה, מצב השוק וניתוח מתחרים

  4. שכבה 4 · המלצות לפעולה: איזה מוצר לא שווה להמשיך למכור, איפה כדאי להתמקד ברבעון הבא

בוקר טוב, הנה מה שחשוב לך היום

מסך הבית של Zora, ה-Insight Hub, מותאם אישית: המערכת יודעת מי המשתמש, מה התפקיד שלו ומה עניין אותו בעבר, ובונה לו KPIs ו-Daily News משלו. היא מחוברת לדאטה הארגוני, למיילים וליומן, ומציפה כל בוקר את מה שהכי רלוונטי: משלוח שמתאחר, חדשות שמשפיעות על העסק, הזדמנות שנפתחה.

איך סומכים על סוכן שנוגע בכסף

בעולמות הפיננסים, טעות של ספרה אחת היא קטסטרופה. אז איך סומכים על סוכן AI? במפגש עלתה השאלה הזאת ישירות, והתשובה של גלית עמדה על שלושה עקרונות.

שלושת עקרונות האמון

  • שקיפות מלאה · כל תשובה במערכת ניתנת לפירוק: מאילו מקורות היא נלקחה, מאיזה PDF ואפילו מאילו עמודים, מאילו טבלאות, עמודות ושורות, ומה הייתה הלוגיקה של הסוכן בדרך

  • הרשאות קריאה בלבד · הסוכנים ב-Read ולא ב-Write: הם מנתחים, חוזים וממליצים, אבל לא מבצעים פעולות ולא משנים דאטה בלי אישור אנושי

  • בקרה חיצונית ותקנים · המוצר עובר בקרות וטסטים של גורם חיצוני, בתהליכי Certified to Sell ו-Certified to Distribute, לפני שהוא משוחרר ללקוחות

היכולת לתת לסוכנים לבצע פעולות בעצמם (Write) נמצאת על השולחן, אבל הגישה היא זהירה: להגדיר במדויק אילו הרשאות יש לכל סוכן, מה הוא רואה ומה הוא רשאי לשנות, ולשחרר את זה בהדרגה. זה שיעור חשוב לכל מי שבונה סוכנים לעסק שלו.

התחנה הבאה: Physical AI

לאן זה הולך? לפי גלית, הגבול הבא הוא Physical AI: רובוטים ומכונות עם אינטליגנציה אמיתית. הביקוש כבר כאן, כי מפעלים ומלונות פשוט לא מוצאים כוח אדם לעבודות פיזיות: הוצאת מוצרים מפס ייצור, העברה לאריזה, זיהוי דפקטים במוצרים וניתוח הסיבות להם.

המערכות האג'נטיות של היום הן המוח. עכשיו מחברים אליו עיניים ואוזניים: הרובוט צריך לראות איפה החבילה ולשמוע מה מבקשים ממנו. Vision ו-Audio הם השכבות שהופכות את המוח האג'נטי לגוף עובד. וגם שאלת העלות חוזרת: מפעל לא יכול להריץ מודלי Frontier על כל תנועה של זרוע רובוטית. הפתרון הוא מודלים קטנים וממוקדים שרצים על החומרה המקומית, כמעט בחינם.

שאלות נפוצות על AI Vision ופתרונות AI בסקייל

מה זה בעצם AI Vision?

AI Vision (או Computer Vision, ראייה ממוחשבת) הוא תחום ה-AI שמנתח תמונות ווידאו: זיהוי אנשים ואובייקטים, מדידת צפיפות, זיהוי מפגעים ודפקטים. זה תחום ותיק שקדם לעידן ה-GenAI, והיום הוא משתלב עם מודלי שפה וסוכנים כדי לתת פתרונות שלמים.

מה זה CityShield ואיך זה עובד?

CityShield היא מערכת עיר חכמה שפותחה בדלויט. היא מתחברת לאלפי מצלמות קיימות ברחבי העיר, בזמן אמת ובהקלטות עבר, מדרגת כל סצנה לפי קריטריונים שהעירייה הגדירה (ניקיון, התקהלויות, גרפיטי ועוד), ומדליקה התראות. במקום שניים-שלושה אנשים שמנסים לצפות באלפי מסכים, המערכת צופה בהכל ומציפה רק את מה שדורש טיפול.

למה לא מריצים הכל על מודלים גדולים בענן?

לא תמיד אפשר ולא תמיד נכון. עיר בלי תשתית אינטרנט מלאה לא יכולה לחבר מצלמות לענן, ואז החישוב רץ על צ'יפ קטן בתוך המצלמה עצמה (כמו NVIDIA Jetson במאות דולרים) עם מודלים קטנים שאומנו לבעיה ספציפית. גם כשיש ענן, שיקולי עלות ו-Latency קובעים. הארכיטקטורה נגזרת מהמציאות של הלקוח, לא מהטכנולוגיה.

מה עם הפרטיות של האנשים שהמצלמות מצלמות?

דאטה של מצלמות עירוניות הוא מידע רגיש שלא יוצא מהעירייה, גם לא לצוות הפיתוח. העבודה נעשית פיזית אצל הלקוח, עם טשטוש פנים חובה על כל הדאטה, ובדיקת המודלים מול התקנים והחוקים שהעירייה מחויבת להם.

מה ההבדל בין סוכן AI לצ'אט רגיל כמו ChatGPT?

סוכן AI הוא מודל חכם שיש לו גם ידיים: גישה לכלים ומערכות שמאפשרים לו לבצע דברים, לא רק לענות. כמו תמנון שכל זרוע היא יכולת: מחשבון, קבצים, מערכות ארגוניות. ההבדל בין סוכן גנרי לסוכן ארגוני הוא הידע: ל-ChatGPT יש את האינטרנט, לסוכן ארגוני יש גם את הידע הפנימי שהחברה צברה, וזה הבידול האמיתי.

איך אפשר לסמוך על סוכן AI בנתונים פיננסיים?

בשלושה מנגנונים: שקיפות (כל תשובה מפורקת למקורות, עד רמת העמוד ב-PDF והעמודה בטבלה), הרשאות קריאה בלבד (הסוכן מנתח וממליץ אבל לא מבצע פעולות בדאטה), ובקרה חיצונית עם תקני Certified to Sell לפני שחרור. אלה עקרונות שכל עסק שבונה סוכנים יכול לאמץ.

האורחת של המפגש

גלית לוין היא מנהלת בכירה בדלויט וחלק מה-Alliance של דלויט ו-NVIDIA העולמית. היא מובילה את הקבוצה הגלובלית שמתעסקת ב-AI, על שני האפיקים שלה: Vision ומערכות אג'נטיות. גלית התחילה תואר ראשון בטכניון בגיל 16, עשתה תואר שני ב-Computer Vision, עבדה כעשור באינטל וכשבע שנים במובילאיי בפיתוח רכבים אוטונומיים, ויש לה מאמרים ופטנטים בעולמות ה-AI וה-Deep Learning.

השורה התחתונה של המפגש: AI לא פותר בעיות בקליק. מי שמצליח בסקייל הוא מי שיודע לפרק את הבעיה יחד עם הלקוח, לבחור ארכיטקטורה שמתאימה למציאות (ולא לדמו), לבנות אמון דרך שקיפות, ולהתקדם שכבה אחרי שכבה. וזה נכון גם לעירייה עם אלפי מצלמות, וגם לעסק קטן שבונה את הסוכן הראשון שלו.

להצטרפות למועדון AI Master