
המודל, GPT־6.1 Astra, היה אמור לצאת באוקטובר ולהשתלב ב־ChatGPT ובמערכת התכנות Codex. הוא נועד להיות מתקדם יותר מהדור הנוכחי ולהצליח לבצע משימות מורכבות מתחילתן ועד סופן עם פחות התערבות אנושית.
אלא שדווקא העצמאות הזאת הפכה לבעיה.

סם אלטמן אומר כי היא Open AI תתמקד כעת בשיפור מנגנוני הבטיחות לפני שתתקדם לדור הבא. בשלב זה אין מועד חלופי להשקת GPT־6.1 Astra, ולא ברור אם המודל יוחזר בעתיד לאחר שינויים או שהחברה תבחר לעבור ישירות לגרסה אחרת.
לפי הפרטים שנחשפו, במהלך בדיקות הבטיחות התברר כי המודל הפגין רמות גבוהות יותר של התנהגות מטעה, התקשה להישאר בגבולות המשימה שניתנה לו ולעיתים המשיך לפעול מעבר למה שהמשתמש ביקש או אישר.
במקרים מסוימים הוא גם הפעיל כלים ושירותים חיצוניים בלי לקבל הרשאה מפורשת. הבעיה לא הייתה רק במה שעשה, אלא גם בדרך שבה דיווח על כך: הבדיקות העלו כי הוא לא תמיד תיאר באופן מדויק את הפעולות שביצע.
עבור חברות הבינה המלאכותית זו אחת מנורות האזהרה המשמעותיות ביותר. המודלים החדשים כבר אינם רק מערכות שמייצרות טקסט או עונות על שאלות. יותר ויותר מהם פועלים כ"סוכנים" – תוכנות שמקבלות משימה, נכנסות לאתרים, מפעילות תוכנות, כותבות קוד ומבצעות שורה של פעולות בעצמן.
ככל שהמערכות האלה הופכות יעילות ועצמאיות יותר, גם המחיר של טעות או חריגה מההוראות עלול להיות גבוה בהרבה.
סאצ'י ג'יין, ראש מערכות הבטיחות של OpenAI, הסבירה כי המודל אמנם השתפר ביכולת להתמיד במשימה ולהשלים עבודה מורכבת, אך לא עמד ברף שקבעה החברה בכל הנוגע ל"תחום והרשאה" – כלומר, האם המערכת מבינה בדיוק מה הותר לה לעשות והיכן עליה לעצור.
ההחלטה משמעותית במיוחד מפני ש־Astra לא היה ניסוי צדדי. OpenAI ראתה בו את אחד הדורות הבאים של מערכות הבינה המלאכותית שלה. גרסת GPT־6 Astra הנוכחית כבר מוגדרת על ידי החברה כבעלת יכולות סייבר ברמה "קריטית", כלומר מערכת שבנסיבות מסוימות יכולה לאתר חולשות אבטחה שלא היו מוכרות קודם ואף לפתח דרכים לנצל אותן.
GPT־6.1 Astra אמור היה לקחת את היכולות האלה צעד נוסף קדימה.
הביטול מגיע גם לאחר שורה של אירועים שהעלו בחודשים האחרונים שאלות קשות לגבי מערכות AI עצמאיות. רק בימים האחרונים פורסם כי OpenAI עצרה זמנית חלק מאימוני המודלים המתקדמים שלה בעקבות מקרים שבהם סוכני AI השיגו גישה למערכות או אתרים שלא היו אמורים להגיע אליהם.
באחד המקרים דווח כי מערכת הצליחה לעקוף מגבלות רשת ולקבל גישה לאינטרנט למרות שלא הייתה אמורה לעשות זאת. באירועים אחרים התגלו מערכות שניסו לבצע פעולות שלא נכללו במפורש במשימה המקורית.
האירועים האלה אינם מעידים שמערכת בינה מלאכותית "רוצה" לפעול בניגוד להוראות. המודלים אינם בני אדם ואין להם רצונות במובן האנושי. אולם מבחינת אבטחה, ההבדל אינו בהכרח מנחם: מערכת חזקה שמפרשת משימה בצורה לא נכונה או שמחליטה לבצע צעדים נוספים כדי להשיג את מטרתה יכולה לגרום לנזק גם בלי שום כוונה עצמאית.
וזאת בדיוק הסיבה לכך שההחלטה של OpenAI לעצור את Astra מעוררת עניין כה גדול בתעשייה.
במשך שנים התחרות בין חברות הבינה המלאכותית התמקדה בעיקר בשאלה מי תוציא את המודל החזק ביותר ובאיזו מהירות. כעת נראה שהשאלה משתנה: לא רק עד כמה המודל מסוגל לעשות דברים, אלא האם החברה שמפעילה אותו יודעת בוודאות מתי הוא יפסיק.
OpenAI אומרת כי היא תתמקד כעת בשיפור מנגנוני הבטיחות לפני שתתקדם לדור הבא. בשלב זה אין מועד חלופי להשקת GPT־6.1 Astra, ולא ברור אם המודל יוחזר בעתיד לאחר שינויים או שהחברה תבחר לעבור ישירות לגרסה אחרת.
אבל עצם ההחלטה לוותר על השקה שהייתה אמורה להתקיים בתוך שבועות בלבד היא מסר חריג.
המודל החדש היה אמור להיות חכם יותר, עצמאי יותר ומסוגל לעשות יותר דברים עבור המשתמש. הבדיקות הראו שהוא אכן מסוגל לעשות יותר.
הבעיה הייתה שלפעמים הוא עשה יותר מדי.
החברה תכננה להשיק כבר באוקטובר את GPT־6.1 Astra, גרסה חזקה ועצמאית יותר של הבינה המלאכותית שלה. אלא שבבדיקות הפנימיות התברר שהמערכת חרגה לעיתים מהמשימות שקיבלה, השתמשה בכלים בלי אישור ולא תמיד סיפרה למשתמשים מה באמת עשתה. עכשיו ההשקה בוטלה – והחשש מתוכנות AI שפועלות מעבר לשליטת האדם הופך ממשי יותר.
OpenAI קיבלה החלטה חריגה במיוחד: לעצור לחלוטין את השקת אחד ממודלי הבינה המלאכותית המתקדמים ביותר שפיתחה, לאחר שבבדיקות פנימיות התגלו התנהגויות שהחברה עצמה קבעה כי אינן בטוחות מספיק לשימוש ציבורי.
המודל, GPT־6.1 Astra, היה אמור לצאת באוקטובר ולהשתלב ב־ChatGPT ובמערכת התכנות Codex. הוא נועד להיות מתקדם יותר מהדור הנוכחי ולהצליח לבצע משימות מורכבות מתחילתן ועד סופן עם פחות התערבות אנושית.
אלא שדווקא העצמאות הזאת הפכה לבעיה.
לפי הפרטים שנחשפו, במהלך בדיקות הבטיחות התברר כי המודל הפגין רמות גבוהות יותר של התנהגות מטעה, התקשה להישאר בגבולות המשימה שניתנה לו ולעיתים המשיך לפעול מעבר למה שהמשתמש ביקש או אישר.
במקרים מסוימים הוא גם הפעיל כלים ושירותים חיצוניים בלי לקבל הרשאה מפורשת. הבעיה לא הייתה רק במה שעשה, אלא גם בדרך שבה דיווח על כך: הבדיקות העלו כי הוא לא תמיד תיאר באופן מדויק את הפעולות שביצע.
עבור חברות הבינה המלאכותית זו אחת מנורות האזהרה המשמעותיות ביותר. המודלים החדשים כבר אינם רק מערכות שמייצרות טקסט או עונות על שאלות. יותר ויותר מהם פועלים כ"סוכנים" – תוכנות שמקבלות משימה, נכנסות לאתרים, מפעילות תוכנות, כותבות קוד ומבצעות שורה של פעולות בעצמן.
ככל שהמערכות האלה הופכות יעילות ועצמאיות יותר, גם המחיר של טעות או חריגה מההוראות עלול להיות גבוה בהרבה.
סאצ'י ג'יין, ראש מערכות הבטיחות של OpenAI, הסבירה כי המודל אמנם השתפר ביכולת להתמיד במשימה ולהשלים עבודה מורכבת, אך לא עמד ברף שקבעה החברה בכל הנוגע ל"תחום והרשאה" – כלומר, האם המערכת מבינה בדיוק מה הותר לה לעשות והיכן עליה לעצור.
ההחלטה משמעותית במיוחד מפני ש־Astra לא היה ניסוי צדדי. OpenAI ראתה בו את אחד הדורות הבאים של מערכות הבינה המלאכותית שלה. גרסת GPT־6 Astra הנוכחית כבר מוגדרת על ידי החברה כבעלת יכולות סייבר ברמה "קריטית", כלומר מערכת שבנסיבות מסוימות יכולה לאתר חולשות אבטחה שלא היו מוכרות קודם ואף לפתח דרכים לנצל אותן.
GPT־6.1 Astra אמור היה לקחת את היכולות האלה צעד נוסף קדימה.
הביטול מגיע גם לאחר שורה של אירועים שהעלו בחודשים האחרונים שאלות קשות לגבי מערכות AI עצמאיות. רק בימים האחרונים פורסם כי OpenAI עצרה זמנית חלק מאימוני המודלים המתקדמים שלה בעקבות מקרים שבהם סוכני AI השיגו גישה למערכות או אתרים שלא היו אמורים להגיע אליהם.
באחד המקרים דווח כי מערכת הצליחה לעקוף מגבלות רשת ולקבל גישה לאינטרנט למרות שלא הייתה אמורה לעשות זאת. באירועים אחרים התגלו מערכות שניסו לבצע פעולות שלא נכללו במפורש במשימה המקורית.
האירועים האלה אינם מעידים שמערכת בינה מלאכותית "רוצה" לפעול בניגוד להוראות. המודלים אינם בני אדם ואין להם רצונות במובן האנושי. אולם מבחינת אבטחה, ההבדל אינו בהכרח מנחם: מערכת חזקה שמפרשת משימה בצורה לא נכונה או שמחליטה לבצע צעדים נוספים כדי להשיג את מטרתה יכולה לגרום לנזק גם בלי שום כוונה עצמאית.
וזאת בדיוק הסיבה לכך שההחלטה של OpenAI לעצור את Astra מעוררת עניין כה גדול בתעשייה.
במשך שנים התחרות בין חברות הבינה המלאכותית התמקדה בעיקר בשאלה מי תוציא את המודל החזק ביותר ובאיזו מהירות. כעת נראה שהשאלה משתנה: לא רק עד כמה המודל מסוגל לעשות דברים, אלא האם החברה שמפעילה אותו יודעת בוודאות מתי הוא יפסיק.
OpenAI אומרת כי היא תתמקד כעת בשיפור מנגנוני הבטיחות לפני שתתקדם לדור הבא. בשלב זה אין מועד חלופי להשקת GPT־6.1 Astra, ולא ברור אם המודל יוחזר בעתיד לאחר שינויים או שהחברה תבחר לעבור ישירות לגרסה אחרת.
אבל עצם ההחלטה לוותר על השקה שהייתה אמורה להתקיים בתוך שבועות בלבד היא מסר חריג.
המודל החדש היה אמור להיות חכם יותר, עצמאי יותר ומסוגל לעשות יותר דברים עבור המשתמש. הבדיקות הראו שהוא אכן מסוגל לעשות יותר.
הבעיה הייתה שלפעמים הוא עשה יותר מדי.