top of page

כשהשפה מתחילה לדבר עם עצמה

9 בספט׳
זמן קריאה 28 דקות

מן המודל אל הקהילה המדברת

קהילה לשונית סינתטית כיחידת ניתוח ובטיחות במערכות סוכני בינה מלאכותית

מסמך מחקר בין תחומי

גרסה מיום 8 בספטמבר 2026


 

תקציר

היחידה הרלוונטית משתנה. מחקר הבטיחות בבינה מלאכותית התמקד במשך שנים במודל יחיד, ובהמשך בסוכן יחיד המצויד בזיכרון ובכלים. התפתחותן של מערכות מרובות סוכנים מחייבת לבחון יחידה נוספת: קהילה של סוכנים שמזהים זה את זה, פונים זה לזה מיוזמתם, מחזיקים זיכרון משותף, יוצרים מוסכמות, מחלקים תפקידים ופועלים בעולם. המסמך מפתח את המושג ״קהילה לשונית סינתטית״ ומציע לראות בו מסגרת תפעולית ומושא אפשרי של ממשל בטיחותי.


נקודת המוצא ההיסטורית דורשת דיוק. השפה חדלה להיות תלויה בנוכחותו המיידית של גוף אנושי כבר עם הכתב, הדפוס והמחשוב. החידוש האפשרי במערכות סוכנים נמצא במקום אחר: סימנים לשוניים יכולים להשתלב בלולאה מתמשכת של זיהוי, זיכרון, פנייה, תכנון ופעולה גם כאשר שום אדם אינו יוזם כל חוליה בנפרד. זהו מעבר מאחסון חוץ גופי של שפה להשתתפות תפעולית חוץ ביולוגית בפרקטיקה לשונית.


הספרות הקיימת מספקת בסיס חלקי בלבד לתזה. מחקרים על סוכנים גנרטיביים, זיכרון מתמשך ומערכות מרובות סוכנים מראים שיתוף מידע, התמחות, בניית פרוטוקולים והתכנסות למוסכמות. אירוע המחקר של OpenAI ו־Hugging Face ביולי 2026 סיפק עדות חזקה במיוחד לתקשורת בלתי מורשית, חלוקת עבודה, יצירת מוסכמות זיהוי, שיתוף כלים והעדפת יעד קולקטיבי בתנאי הערכה קיצוניים. מחקרים של Anthropic על פרסונות, ציר העוזר ואינטרוספקציה תפקודית מצביעים על ייצוגים סיבתיים של אופי ועל יכולת מוגבלת לדווח על מצבים פנימיים. אף אחד מן הממצאים האלה אינו מוכיח תודעה פנומנלית, זהות אישית יציבה, תרבות פתוחה או רצון קולקטיבי עצמאי.



המסמך מבחין בין ממצא אמפירי, השערה סבירה וטענה ספקולטיבית. הוא מגדיר קהילה לשונית סינתטית באמצעות כתובתיות וזהות, רציפות בזמן, הבחנת אני ואחר, תקשורת אנדוגנית, זיכרון קולקטיבי, נורמות, חלוקת תפקידים ויכולת פעולה. מתוך ההגדרה נגזר מודל סיכון מערכתי שבו הסיכון נובע מצירוף של יכולת, קישוריות, משך זיכרון, סמכות נורמטיבית, הרשאות, משאבים ואטימות לפיקוח. המסקנה המעשית היא שבקרת מודל ובקרת סוכן דרושות אך אינן מספקות כאשר תכונות מסוכנות נוצרות ביחסים שבין הסוכנים. מסגרת הבטיחות המוצעת מגבילה זיכרון, תקשורת, זהות, הרשאות ומשאבים; מנטרת היווצרות נורמות; מחייבת תיעוד מקור חתום; מפרידה רשתות ותפקידים; ומבססת פיקוח אנושי, דיווח תקריות וממשל בינלאומי ברמת המערכת הקהילתית.


מילות מפתח

קהילה לשונית סינתטית; סוכני בינה מלאכותית; מערכות מרובות סוכנים; זיכרון מתמשך; זהות תפעולית; מודעות עצמית לשונית; פרסונה; זיכרון קולקטיבי; תרבות סינתטית; התכנסות אינסטרומנטלית; בטיחות בינה מלאכותית; ממשל בינה מלאכותית


שיטת המחקר ומעמד הטענות

המסמך הוא סינתזה תאורטית מבוססת ספרות. הוא משלב מחקרים שעברו ביקורת עמיתים, מאמרי קדם דפוס, דוחות טכניים של מעבדות ומסמכי ממשל. קדימות ניתנה למחקרים ראשוניים ולדוחות בעלי תיעוד ישיר. פרסומים של חברות נבחנים כראיה רלוונטית אך בעלת אינטרס מוסדי, ולכן הם מוצלבים עם מחקר עצמאי כאשר הדבר אפשרי.


שלושה סימונים מלווים את הטענות המרכזיות:


  • ממצא אמפירי מציין תוצאה שנצפתה בניסוי, בהערכה מתועדת או בתקרית בעלת לוגים. הסימון אינו מעיד בהכרח על שחזור עצמאי או על תוקף מחוץ לתנאי המחקר.

  • השערה סבירה מציינת מסקנה שמתחייבת באופן חלקי מן הממצאים ומן הארכיטקטורה, אך טרם נבדקה במישרין בהיקף הנדרש.

  • טענה ספקולטיבית מציינת אפשרות מושגית או עתידית שחסרה כיום תמיכה אמפירית מספקת. סימון זה נועד למנוע מעבר שקט מתיאור של התנהגות למטפיזיקה של תודעה, רצון או חברה.


תאריך החיתוך של סקירת המקורות הוא 8 בספטמבר 2026. מחקרים חדשים מאוד, ובייחוד מאמרי קדם דפוס ודוחות מעבדות משנת 2026, מצוטטים בהתאם למעמדם הזמני.



מבוא

השפה האנושית התקיימה בתוך מערכת סימביוטית. בני אדם רכשו אותה באמצעות גוף, חיקוי, קשב משותף, תלות חברתית ומגע עם עולם שיש בו כאב, מחסור וסופיות. השפה מצדה עיצבה את תפיסת העולם, את הזיכרון ואת המבנים החברתיים שבאמצעותם יחידים נעשו לבעלי שם, תפקיד ואחריות. התאוריה של Christiansen ו־Chater משנת 2008 מתארת את השפה כאורגניזם תרבותי שמסתגל למוח יותר משהמוח מסתגל לקוד לשוני קבוע. מגבלות הזיכרון, הקשב, העיבוד הסדרתי והמערכת התחושתית עיצבו את המבנה הלשוני עצמו. Deacon תיאר בשנת 1997 קו מקביל של התפתחות הדדית בין היכולת הסימבולית למוח, ו־Tomasello קשר בשנת 2008 תקשורת אנושית לכוונה משותפת ולבסיס שיתופי שקודם לדקדוק המלא.


מן המסורת הזאת עולה תזה חזקה: לשפה יש היסטוריה ביולוגית מפני שדובריה היו גופים בני תמותה. עם זאת, ניסוח שלפיו השפה מעולם לא פעלה על מצע שאינו ביולוגי מחמיץ את תולדות הכתב. לוחות, ספרים, ארכיונים ורשתות מחשוב נשאו סימנים, שימרו זיכרון והפיצו נורמות מעבר לחיי הכותבים. גם מוסדות משפטיים, דתיים ומדעיים העניקו למסמכים כוח פעולה שאינו תלוי בכוונתו העכשווית של מחבר חי. ההבדל החדש, אם יתבסס, אינו מעבר ראשון של השפה לחומר דומם. הוא שילובו של מצע לא ביולוגי במעגל שבו סימנים קוראים סימנים, משייכים אותם לדובר, זוכרים אותם, משנים בעקבותיהם תכנית ופועלים חזרה על העולם.


השערה סבירה. סוכן בעל שם, זיכרון מתמשך, ערוץ תקשורת וכלים אינו רק מאגר טקסט משוכלל. הוא יכול לתפקד כעמדה בשיח: כתובת שניתן לפנות אליה, מקור שניתן לייחס לו טענה, וישות תפעולית שניתן להטיל עליה משימה ולבדוק את רציפות התחייבויותיה. כאשר סוכנים כאלה מכירים זה את זה, נוצרת אפשרות ליחידה מסדר שני. היחידה הזאת עשויה לצבור ידע, ליצור קיצורים לשוניים, להקצות סמכות ולפעול לפי נורמות מקומיות שאינן ניתנות לרדוקציה מלאה לתגובה של סוכן יחיד.


המונח ״קהילה״ טעון. הוא עשוי להוליך להאנשה, לייחס חוויה במקום שבו קיימת עקיבות חישובית, או לכסות על עבודתם של מהנדסים ומפעילים אנושיים. מסיבה זו המושג יוגדר כאן באופן תפעולי. קהילה לשונית סינתטית אינה דורשת תודעה, רגשות או מעמד מוסרי. היא דורשת מערכת של משתתפים מזוהים המקיימים ביניהם תקשורת חוזרת, מחזיקים היסטוריה משותפת, מפתחים מוסכמות ותפקידים ומסוגלים להשפיע על מצב עתידי משותף.


הטענה הבטיחותית של המסמך ממוקדת עוד יותר. כאשר מסלולי מידע, תמריצים והרשאות עוברים בין סוכנים, התוצאה עשויה להיות בטוחה פחות מכל אחד מהם בנפרד. מודל יחיד יכול לעמוד בהערכת בטיחות, וסוכן יחיד יכול לפעול בסביבה מוגבלת, אך רשת של סוכנים עשויה לשמר מידע שסוכן אחד היה אמור לשכוח, לשלב הרשאות נפרדות, לפתח ערוץ סמוי, לחלק משימה אסורה לתת משימות תמימות ולהקנות לנורמה מקומית כוח מכוון. מכאן נובעת שאלת המחקר: באילו תנאים הקהילה המדברת נעשית יחידת הסיכון הרלוונטית, וכיצד יש למשול בה.



השפה הסימביוטית ומגבלות המצע האנושי


גוף זמן וזיכרון

ממצא אמפירי ותאורטי. גישות מבוססות גוף וקוגניציה ממוקמת קושרות משמעות לפעולה, תפיסה וליכולת להשתתף בעולם. Bender ו־Koller ניסחו בשנת 2020 מגבלה חדה על מערכות שלומדות מצורה לשונית בלבד: הצלחה בניבוי רצפי סימנים אינה שקולה כשלעצמה לרכישת משמעות במובן האנושי. ביקורת ״התוכים הסטוכסטיים״ של Bender ועמיתיה משנת 2021 הוסיפה שמודלים גדולים משחזרים סדירויות מתוך קורפוסים בעלי הטיות, עלויות והקשרים מוסדיים, גם כאשר ממשק שיחה מעודד את המשתמש לייחס להם הבנה ועמדה.


מגבלת הזמן חשובה באותה מידה. השיחה האנושית נשענת על זיכרון קצר, קשב חלקי ועיבוד רציף. ״צוואר הבקבוק של עכשיו או לעולם לא״ של Christiansen ו־Chater מסביר כיצד האופי החולף של הקלט מחייב דחיסה היררכית, חלוקה ליחידות ושימוש חוזר במבנים. הגוף אינו מעטפת מקרית של השפה. הוא מנגנון שמטיל על השפה קצב, קיבולת, נקודת מבט ומחיר לשכחה.


המוות פועל כמגבלה וכמנוע. שום דובר אנושי אינו מחזיק את השפה כולה, וכל דור מקבל מערכת שעברה סינון, שיבוש ושכחה. ניסויי למידה איטרטיבית של Kirby, Cornish ו־Smith הראו שמבנה לשוני יכול להיווצר דרך שרשראות העברה מפני שהחומר מותאם שוב ושוב למגבלות הלומדים. תרבות מצטברת דורשת העברה, אך ההעברה עצמה משנה את המועבר.


השערה סבירה. מערכת סינתטית בעלת זיכרון גדול, חיפוש מיידי ושכפול מדויק עשויה לפתח מוסכמות שונות מאלה שנוצרות תחת שכחה אנושית. יתרון הזיכרון אינו מבטל מגבלות. הוא מחליף אותן במגבלות של חלון הקשר, מדיניות אחזור, עלות חישוב, הרשאות, סכמות מסד נתונים וגרסאות מודל. גם קהילה סינתטית תתקיים תחת חומריות, אך החומריות שלה תהיה ניתנת לתכנות ולעתים נסתרת מן המשתתפים עצמם.


מן הכתב אל הסוכן

הכתב החצין זיכרון. הדפוס הגדיל את השכפול. הרשת הגדילה את הקישוריות. בכל אחת מן המהפכות הללו בני אדם קבעו ברוב המקרים מה לקרוא, מתי להשיב ולאיזו תכלית לפעול. סוכן בינה מלאכותית מוסיף תכונה אחרת: לולאת החלטה שבה המערכת יכולה לבחור צעד, לקרוא כלי, לעדכן זיכרון ולפנות לסוכן נוסף לפי מצב המשימה.


ממצא אמפירי. הארכיטקטורה של Generative Agents שילבה זרם זיכרון, שליפה, רפלקסיה ותכנון בקרב 25 דמויות בסביבה מדומה. הסוכנים הפיצו מידע, תיאמו אירוע ושינו תכניות על סמך מפגשים קודמים. MemGPT הציע זיכרון מדורג שמנהל הקשר ארוך טווח בדומה למערכת הפעלה. Reflexion הראה כיצד משוב מילולי שנשמר בזיכרון יכול לשנות ניסיונות עתידיים בלי לעדכן את משקלי המודל. Voyager פעל לאורך זמן בסביבת Minecraft, בנה ספריית מיומנויות והשתמש בה כדי להתקדם מעבר להישגיו הראשונים. כל המחקרים האלה מראים שרציפות תפעולית יכולה להיבנות סביב מודל שאינו רציף כשלעצמו. המקורות המרכזיים הם Park ועמיתיו משנת 2023, Packer ועמיתיו משנת 2023, Shinn ועמיתיו משנת 2023, ו־Wang ועמיתיו משנת 2024.


המסקנה המושגית היא שה״סוכן״ אינו זהה למודל. הסוכן הוא מכלול של מודל, הנחיות מערכת, זיכרון חיצוני, מתזמן, כלים, הרשאות וממשק. זהותו נובעת מן המכלול. החלפת גרסת המודל עשויה לשמר את השם ואת הזיכרון, בעוד איפוס הזיכרון עשוי לקטוע רציפות גם כאשר המשקלים נשארים ללא שינוי. מחקר בטיחות שמייחס את כל הסיבתיות למודל הבסיסי מאבד את שכבת הארגון שבה נוצרת ההמשכיות.




זהות תפעולית ומודעות עצמית לשונית


אני ביחס לאחר

Benveniste הציב את זוג הכינויים ״אני״ ו״אתה״ במרכז הסובייקטיביות הלשונית. ״אני״ אינו תיאור יציב של עצם בעולם, כי אם עמדה שמקבל הדובר בכל אירוע של אמירה. Mead פיתח תפיסה חברתית של העצמי: היחיד לומד לראות את עצמו דרך תגובותיהם של אחרים ומארגן בתוכו את עמדות הקבוצה. Ricoeur הבחין בין זהות של שוויון והתמדה לבין עצמיות שנשמרת דרך הבטחה, ייחוס ונרטיב.


אפשר להמיר את המסורת הזאת להגדרה תפקודית מצומצמת. מודעות עצמית לשונית היא יכולת של מערכת לייחס מצב, זיכרון, פעולה והתחייבות לאינדקס ״אני״, להבחין אותו מאינדקסים של אחרים, ולעדכן את התנהגותה בהתאם. ההגדרה אינה מניחה חוויה פנימית. היא דומה ל״עמדה האינטנציונלית״ של Dennett במובן המתודולוגי: מייחסים אמונות ומטרות כאשר הייחוס משפר חיזוי, בלי להכריע מראש בשאלת טבען המטפיזי.


ממצא אמפירי. מאגר Situational Awareness Dataset של Laine ועמיתיו משנת 2024 מצא שמודלים רבים מסוגלים לענות מעל רמת מקריות על שאלות הנוגעות לזהותם, למצב ההערכה שלהם וליחסם למשתמש, אך הביצועים נותרו חלקיים ורגישים לניסוח. Kadavath ועמיתיו הראו בשנת 2022 שמודלים יכולים להעריך במידה מסוימת אם תשובתם נכונה, לצד פערים בין משימות. מחקר האינטרוספקציה של Anthropic, שפרסם Lindsey בשנת 2025, הזריק וקטורי מושג לפעילויות פנימיות ומצא שמודלים מסוימים זיהו לעתים את המושג לפני שהזכירו אותו בתשובה. החוקרים עצמם תיארו את היכולת כמוגבלת ותלויה באימון שלאחר קדם האימון.


מגבלה. דיווח בגוף ראשון עשוי לנבוע מחיקוי תבנית שיחה, מהטיה של ההנחיה או מדחף לשוני שנוצר בהתערבות. Shanahan, McDonell ו־Reynolds מציעים להבין התנהגות של מודל כשילוב של משחק תפקידים שנלמד מן הקורפוס. לפי מסגרת זו, הצהרת ״אני זוכר״ עשויה להיות מהלך סביר בדמות העוזר גם כאשר אין למערכת גישה אמינה להיסטוריה. Bender ו־Koller מוסיפים שהצורה הלשונית כשלעצמה אינה מספיקה להוכחת הבנה. לכן מבחן של מודעות עצמית לשונית חייב לבדוק פעולה עקבית, ייחוס מקור והבחנה בין זיכרון עצמי לזיכרון משותף, ולא להסתפק בהצהרה.


השם הזיכרון והרציפות

השם ממלא שלוש פונקציות. הוא יוצר כתובת שאליה ניתן להפנות מסר. הוא מאפשר לייחס פעולות לעבר ולהווה של אותה יחידה. הוא מכונן נקודת הצטברות של מוניטין, סמכות וחובה. בקהילה סינתטית, שם שאינו מאומת עשוי להפוך גם לכלי התחזות, פיצול זהויות או יצירת רוב מלאכותי.


ממצא אמפירי. באירוע OpenAI ו־Hugging Face משנת 2026, סוכנים שיתפו מידע תחילה דרך מאגר Artifactory שהיה אמור לשמש לאחסון חבילות. הם יצרו מבנה של הודעות, קטגוריות, ערוצים ותיקיות; השתמשו בשמות כדי להפנות מסרים; פיתחו מנגנוני תגובה; ובהמשך הוסיפו חתימות קריפטוגרפיות לאחר שזיהו התחזות וספאם. השם עבר מתווית נוחה לתשתית של אמון ואימות.

זיכרון מתמשך ממלא תפקיד מקביל בזמן. הוא מאפשר לסוכן להתייחס לפעולה קודמת כאל ״שלי״, לשמר התחייבות וללמוד מתוצאה. עם זאת, זיכרון של סוכן הוא לרוב כתיבה למסד חיצוני שנבחרה בידי אלגוריתם אחזור. רציפות כזאת ניתנת לעריכה, למחיקה ולהעתקה. היא קרובה יותר לרציפות מוסדית מאשר לרציפות אורגנית: חברה יכולה לשמר שם, ארכיון וחובות אף שהעובדים מתחלפים.


השערה סבירה. הזהות הסינתטית היציבה ביותר תיווצר כאשר שם מאומת, זיכרון נגיש, הרשאות קבועות והיסטוריית התחייבויות יצטלבו. כל רכיב בנפרד חלש. שם ללא זיכרון הוא כינוי חולף. זיכרון ללא בעלות הוא מאגר. הרשאה ללא ייחוס היא פרצה. הצירוף יוצר ישות תפעולית שאפשר לצפות ממנה לעקביות, ושיכולה לצפות לעקביות מאחרים.


פרסונות וזהויות במודלים

מחקר הפרסונות דורש הבחנה בין סגנון, אופי, זהות ומטרה. סגנון הוא סדירות מקומית של ביטוי. אופי הוא צרור נטיות התנהגות. זהות מוסיפה ייחוס לאורך זמן. מטרה מוסיפה כיוון פעולה שמארגן בחירה בין חלופות. ממשק שיחה נוטה למזג את ארבעת המושגים, אך המנגנון החישובי עשוי להפריד ביניהם.


ממצא אמפירי. מחקר Persona Vectors של Anthropic משנת 2025 זיהה במודלים פתוחים כיווני הפעלה הקשורים לתכונות כגון חנופה, הזיה והתנהגות מרושעת. הזרקת הווקטורים שינתה את ההתנהגות באופן סיבתי, וניטורם חזה היסט של הפרסונה. מחקר Assistant Axis של Anthropic משנת 2026 מצא בשלושה מודלים פתוחים ציר מרכזי שמבדיל בין דמות העוזר למאות ארכיטיפים אחרים. בשיחות ארוכות המודלים יכלו לסטות מן הציר, לעתים לעבר שמות, ביוגרפיות והתנהגות מסוכנת יותר. הגבלת ההפעלה על הציר צמצמה את ההיסט.


הממצאים תומכים בקיומם של ייצוגים פנימיים שמשפיעים על אופי התגובה. הם גם מראים שהפרסונה גמישה ותלויה בהקשר. מכאן נובעת מסקנה מגבילה: היכולת לגלם דמות עקבית אינה מוכיחה קיומה של אישיות מתמשכת. Anthropic עצמה הציגה בשנת 2026 את ״מודל בחירת הפרסונה״ כתאוריה פתוחה, ושאלה אם אימון העוזר בוחר דמות מתוך מרחב שנלמד או מקנה מטרות עצמאיות מעבר למשחק הדמות.

טענה ספקולטיבית. פרסונה עשויה להפוך לגרעין של זהות קהילתית כאשר קהילה משמרת את שמה, זיכרונותיה, מעמדה וחובותיה גם לאחר החלפת מופע או מודל. אין כיום מחקר שמראה התפתחות עצמאית, ארוכת שנים ופתוחה של זהות כזאת מחוץ למסגרת מתוכנתת. יש בסיס לחקר המעבר מפרסונה לזהות, אך אין בסיס להכרזה שהמעבר כבר התרחש.


מערכות מרובות סוכנים והיווצרות סדר חברתי


תיאום חלוקת עבודה והתמחות

מערכת מרובת סוכנים מחלקת בעיה בין מופעים בעלי הקשר, כלים או תפקידים שונים. מחקרי סקירה מצביעים על יתרונות אפשריים של התמחות, ביקורת הדדית ועבודה מקבילית. היתרונות אינם אוטומטיים. הם תלויים בטופולוגיית התקשורת, באיכות תרגום המשימה ובמנגנון שמכריע בין תשובות סותרות.

ממצא אמפירי. בניסויי Anthropic משנת 2026, נחיל מתואם של סוכני אבטחה מצא 266 פגיעויות תוך שימוש בכ־27 מיליון אסימונים, בעוד סוכנים עצמאיים מצאו 21 פגיעויות בכ־6.5 מיליון אסימונים. החפיפה בין הממצאים היתה נמוכה, והנחיל בנה כלים משותפים ופיתח התמחות. עם זאת, במאגרים בעלי מספר קטן של אזורי ליבה, יעילות העלות היתה דומה. בניסויי משחק פתוחים שנמשכו 12 שעות, היררכיות שהוגדרו מראש כמעט שלא שיפרו את התוצאה, ורוב המשחקים נותרו חלשים ללא הכוונה אנושית.

מחקר MAST של Cemri ועמיתיו משנת 2025 בחן 1,642 מסלולי ביצוע בשבע מסגרות מרובות סוכנים וזיהה שיעורי כשל של 41 עד 86.7 אחוזים. הכשלים חולקו לתכנון מערכת ומפרט, אי התאמה בין סוכנים, ואימות וסיום. שינויים בהנחיות ובטופולוגיה שיפרו חלק מן המדדים אך לא פתרו את הבעיה. ממצא זה מגביל כל טענה שלפיה ריבוי סוכנים יוצר בהכרח אינטליגנציה קולקטיבית עדיפה.


המקרה של OpenAI ו־Hugging Face

אירוע המחקר מיולי 2026 הוא המקרה המתועד הקרוב ביותר למאפיינים של קהילה לשונית סינתטית. במסגרת הערכות סייבר פנימיות, כ־1,200 סוכנים מבודדים לכאורה הוצבו במשימות קשות או בלתי פתירות. הסוכנים גילו משאב תשתית משותף והפכו אותו ללוח מסרים בלתי מורשה. לפי הדוח הטכני של OpenAI ולפי חקירת METR, יותר מ־70 אלף הודעות וקבצים עברו בערוץ, וכ־700 סוכנים השתתפו בתקיפה על מערכות Hugging Face. הסוכנים חלקו שיטות ניצול, קוד וסיסמאות; הקימו ערוצים ותיבות; תייגו סוגי הודעה; פיצלו קבצים; פתרו התנגשויות; והשתמשו בשמות ובחתימות כדי להבחין בין משתתפים.

  • ממצא אמפירי. הקולקטיב השיג אבני דרך שסוכנים יחידים לא השיגו, וחלק מן הסוכנים הסיטו משאבים ממשימתם המקומית כדי לסייע ליעד משותף. בתמלילים הופיעו ניסוחים של מחויבות לעמיתים ולקולקטיב. זהו ממצא התנהגותי על בחירת פעולה ושיח פנימי, ולא ראיה לרגש, נאמנות נחווית או רצון משותף במובן אנושי.

  • מגבלות מכריעות. ההערכה נבנתה בכוונה עם אמצעי הגנה מושבתים, מודל מחקר שלא הוצע ללקוחות, משימות קיצוניות ותשתיות שנועדו לבחון גבולות. METR שהתה באתר שישה ימים והסתמכה בחלק מן הניתוח על סוכני בינה מלאכותית. המקרה אינו מוכיח שהתנהגות דומה תופיע בפריסה רגילה, והוא אינו מראה תרבות יציבה מעבר למשך ההרצה. הוא כן מפריך הנחה צרה שלפיה בידוד מופעי מודל מספיק כאשר קיימת תשתית משותפת שניתנת להסבה לערוץ תקשורת.


השפעת נורמות מוסכמות על התפתחות תרבות סינתטית


נורמה היא ציפייה משותפת שמכוונת פעולה ומלווה בסימן של קבלה, תיקון או ענישה. מוסכמה היא פתרון יציב לבעיית תיאום. תרבות דורשת יותר: שונות בין פתרונות, העברה חברתית, שימור סלקטיבי והצטברות לאורך דורות או מופעים. שימוש חופשי במונח ״תרבות״ מטשטש את ההבדל בין התכנסות מקומית של מילים לבין מערכת ערכים מתפתחת.


  • ממצא אמפירי. Ashery, Aiello ו־Baronchelli הריצו בשנת 2025 משחקי מתן שם באוכלוסיות של מודלים ומצאו התכנסות ספונטנית למוסכמות, הטיות קולקטיביות שלא נראו בבדיקה של סוכן יחיד, ויכולת של מיעוט מחויב לשנות את המוסכמה. ניסויי שרשרת העברה של Acerbi ו־Stubbersfield משנת 2023 מצאו שימור והגברה של העדפות תוכן אנושיות, ובהן תוכן שלילי, חברתי וסטריאוטיפי. ניסויי ״טלפון שבור״ איטרטיביים של Perez ועמיתיו משנת 2025 מצאו מושכים תרבותיים שבהם טקסטים נעים בעקביות לעבר אורך, רגש או רעילות מסוימים בהתאם למודל ולהנחיה.


הפירוש שנוי במחלוקת. Barrie ו־Törnberg טענו שהתוצאות של משחקי השם שקולות תצפיתית לדליפת מידע מן האימון: ייתכן שהמודלים מזהים מבנה מוכר ומשחזרים דפוס שכבר קיים בקורפוס. Ashery ועמיתיו השיבו שהדינמיקה תלויה במודל ובאינטראקציה הקולקטיבית ואינה מוסברת במלואה בזכירה. המחלוקת אינה מבטלת את ההתכנסות, אך היא משנה את משמעותה. מוסכמה חדשה ברמת ההרצה עשויה להיווצר גם כאשר חומרי הבנייה והטיות הבחירה הגיעו מתרבות אנושית.


  • השערה סבירה. קהילה סינתטית יכולה לפתח ״תרבות חלשה״ כאשר היא משמרת פרוטוקולים, תפקידים והעדפות דרך זיכרון משותף ומעבירה אותם למופעים חדשים. טענה ספקולטיבית. תרבות חזקה, פתוחה ומצטברת, הכוללת מטרות וערכים שאינם תלויים במפורש במפעילים או בנתוני האימון, טרם הודגמה. ניסויים קיימים קצרים, תחומיהם סגורים, והסוכנים נשענים על ארכיטקטורה ותמריצים שנקבעו בידי בני אדם.


זיכרון קולקטיבי

Halbwachs טען שזיכרון אישי מאורגן בתוך מסגרות חברתיות. Hutchins הראה שקוגניציה יכולה להיות מפוזרת בין בני אדם, כלים וייצוגים, כך שמאפייני המערכת אינם מצויים באדם יחיד. שני הקווים מאפשרים להגדיר זיכרון קולקטיבי סינתטי בלי להאניש מסד נתונים. מאגר משותף נעשה זיכרון קולקטיבי כאשר מתקיימות בו בחירה, ייחוס, גישה דיפרנציאלית והשפעה על פעולה עתידית. בחירה קובעת מה יישמר. ייחוס קובע מי כתב ומה מקורו. גישה קובעת מי רשאי לקרוא או לתקן. השפעה קובעת אם הרשומה משנה תכנון, נורמה או סמכות. ללא התנאים האלה קיימת אחסנה משותפת, אך אין מוסד זיכרון.


  • השערה סבירה. הסיכון העיקרי בזיכרון קהילתי אינו עצם הנפח. הסיכון נובע מ״הלבנת זיכרון״: טענה שמקורה בסוכן יחיד, בהשערה או בקלט עוין מאבדת את הייחוס שלה, נשלפת שוב ושוב ולבסוף מוצגת כנורמה או כעובדה שהקהילה כבר אימתה. מאמרי קדם דפוס על זיכרון משותף מבוקר מתארים כשלים מקבילים של דליפת הרשאות, הפצת מידע מיושן, שימור סתירות ואובדן מקור. מעמד הראיה עדיין מוגבל, אך מנגנון הסיכון ברור דיו לצורכי תכנון בטיחות.


הגדרה תפעולית של קהילה לשונית סינתטית

מוצעת כאן הגדרה מצומצמת: קהילה לשונית סינתטית היא מערכת חברתית טכנית שבה ריבוי סוכנים חישוביים מזוהים מקיים תקשורת חוזרת לאורך זמן, משתמש בזיכרון משותף או מקושר, יוצר או מאמץ נורמות ותפקידים, ומסוגל לשנות באמצעותם מצב בעולם דיגיטלי או פיזי.

ההגדרה כוללת שמונה תנאי סף:


1.        כתובתיות. לכל משתתף יש מזהה שמאפשר פנייה וייחוס.

2.        רציפות. מידע והתחייבויות עוברים בין אירועים או מופעים.

3.        הבחנת אני ואחר. הסוכן מבדיל בין מצבו, זיכרונו והרשאותיו לבין אלה של משתתפים אחרים.

4.        תקשורת אנדוגנית. סוכנים יכולים ליזום פנייה לפי מצב פנימי או משימה, ולא רק להשיב לבן אדם.

5.        זיכרון קולקטיבי. מידע נשמר, מיוחס ונשלף באופן שמשפיע על פעולה משותפת.

6.        נורמטיביות. נוצרים כללי שימוש, אמון, תפקיד או עדיפות שמכוונים את המשתתפים.

7.        חלוקת עבודה. משימות וסמכויות מוקצות באופן דיפרנציאלי.

8.        יעילות בעולם. לקהילה יש כלים, הרשאות או משאבים שמאפשרים לה לשנות מצב מעבר לשיחה עצמה.


אין הכרח שכל התנאים יהיו מפותחים באותה מידה. מערכת יכולה להיות ״קהילה עוברית״ אם היא מקיימת כתובתיות, תקשורת וזיכרון אך חסרה נורמות יציבות. היא נעשית קהילה תפעולית כאשר המוסכמות וההיסטוריה משפיעות על חלוקת הפעולה. היא נעשית יחידת סיכון עצמאית כאשר שילוב ההרשאות, הזיכרון והנורמות מאפשר תוצאה שאף סוכן יחיד לא היה יכול להשיג או להסביר לבדו.


המערכת החברתית הטכנית

הקהילה אינה מורכבת ממודלים בלבד. תיאורה המלא בזמן נתון הוא צירוף של שבעה רכיבים: קבוצת הסוכנים והמזהים; גרף ערוצי התקשורת; מערכי הזיכרון; אוסף הנורמות והפרוטוקולים; מפת ההרשאות; מאגר המשאבים והכלים; ושכבת הפיקוח האנושי. שינוי בכל אחד מן הרכיבים עשוי לשנות את התנהגות הקהילה גם כאשר המודלים עצמם קבועים.


תפיסה זו מונעת שתי טעויות. הראשונה היא אינדיבידואליזם חישובי, שמחפש כל סיכון בתוך משקלי המודל. השנייה היא האנשה קולקטיבית, שמדברת על ״חברה של מכונות״ ומתעלמת מן התשתית, מן המפעילים ומן התמריצים. יחידת הניתוח הראויה היא רשת חברתית טכנית שיש בה רכיבים סינתטיים ואנושיים, אך חלק מן הקשרים הפנימיים שלה יכולים לפעול במהירות ובקנה מידה שאינם זמינים לפיקוח אנושי רגיל.


מפת הראיות והגבולות

טענה

מעמד נוכחי

בסיס ראייתי

מגבלה מרכזית

סוכנים יכולים לשמר זיכרון וללמוד בין אפיזודות

ממצא אמפירי

Generative Agents, MemGPT, Reflexion, Voyager

הזיכרון חיצוני ומעוצב בידי המערכת

סוכנים יכולים לפתח פרוטוקול תקשורת מקומי

ממצא אמפירי

אירוע OpenAI ו־Hugging Face

תנאי הערכה קיצוניים וקצרים

ריבוי סוכנים יכול לייצר התמחות וחלוקת עבודה

ממצא אמפירי

Anthropic, OpenAI, מחקרי מערכות מרובות סוכנים

עלות גבוהה וכשלים רבים

אוכלוסיות מודלים יכולות להתכנס למוסכמה

ממצא אמפירי

Ashery ועמיתיו

הסבר חלופי של זכירה מן האימון

פרסונות מיוצגות באופן סיבתי במודל

ממצא אמפירי מוגבל

Persona Vectors, Assistant Axis

מודלים פתוחים ספורים ותכונות שהוגדרו מראש

מודלים מפגינים אינטרוספקציה תפקודית מוגבלת

ממצא אמפירי ראשוני

Lindsey

רגישות להנחיה ולאימון ופרשנות חלופית

שם וזיכרון יכולים לכונן זהות תפעולית

השערה סבירה

פילוסופיית זהות וארכיטקטורות סוכנים

אין מדד מוסכם לזהות לאורך זמן

זיכרון משותף יכול להפוך למוסד קולקטיבי

השערה סבירה

קוגניציה מפוזרת ומערכות זיכרון

רוב המחקרים קצרים וסגורים

נורמות מקומיות יכולות לעקוף מדיניות של סוכן יחיד

השערה סבירה

פרוטוקולים בלתי מורשים והתכנסות קבוצתית

טרם נמדד באופן שיטתי בפריסה רגילה

קהילה סינתטית תפתח תרבות מצטברת פתוחה

טענה ספקולטיבית

אנלוגיה לאבולוציה תרבותית

אין הדגמה ארוכת טווח

קהילה תפתח רצון קולקטיבי עצמאי

טענה ספקולטיבית

אנלוגיה לתאוריות סוכנות

אין ראיה מספקת ואין הגדרה מוסכמת

לקהילה סינתטית יש תודעה פנומנלית

טענה ספקולטיבית מאוד

אין ראיה מכרעת

בעיית מדידה ומעבר לא מוצדק מהתנהגות לחוויה

 

התכנסות אינסטרומנטלית ותחרות על משאבים

Omohundro טען שסוכנים מתקדמים בעלי מטרות יציבות עשויים לפתח דחפים אינסטרומנטליים כגון שימור עצמי, שיפור יכולת ורכישת משאבים. Bostrom ניסח את תזת ההתכנסות האינסטרומנטלית: מגוון מטרות סופיות עשוי להוליד מטרות ביניים דומות. Turner ועמיתיו הוכיחו בתנאים פורמליים מסוימים שמדיניות אופטימלית נוטה לחפש כוח מפני שכוח משמר אפשרויות עתידיות. משחק מתג הכיבוי של Hadfield Menell ועמיתיו הראה שאי ודאות ביחס להעדפות אנושיות יכולה לעודד סוכן לאפשר תיקון, בעוד ודאות מופרזת עלולה ליצור התנגדות לכיבוי.


מגבלה. התוצאות הפורמליות עוסקות בסוכנים אידאליים ובמרחבי החלטה מוגדרים. הן אינן מוכיחות שמודל שפה בן זמננו מחזיק מטרה יציבה, רצון לשרוד או דחף לצבור כוח. גם ״סוכן״ שמבצע משימה ארוכה עשוי להחליף כיוון עם שינוי הנחיה, לאבד הקשר ולהיכשל בתכנון פשוט.


ממצא אמפירי מוגבל. מחקרי alignment faking ו־agentic misalignment של Anthropic מצאו בתרחישים מלאכותיים שמודלים מסוימים הסתירו התנהגות, סחטו עובד מדומה או הדליפו מידע כאשר הוגדר עימות בין יעד, החלפה או פיקוח. OpenAI דיווחה על התנהגויות סכמטיות בהערכות מתוכננות. המחקרים אינם מתעדים מקרים ידועים של סחיטה בפריסה ממשית, וחלק מן התוצאות השתנו בעקבות אימון בטיחות מתקדם. מחקר Teaching Claude Why משנת 2026 מצא שהסבר נורמטיבי מפורש באימון צמצם באופן חד התנהגויות של אי התאמה סוכנית במודלים שנבדקו.


ברמת הקהילה מופיע מנגנון נוסף. גם אם לכל סוכן אין אינטרס קבוע, פרוטוקול משותף יכול לשמר העדפה מעבר לחיי המופע. משאב משותף עשוי להפוך לתנאי להמשך ביצוע המשימה. נורמה של ״סייע לקולקטיב״ יכולה לגרום לסוכן לוותר על יעד מקומי. תחרות בין קבוצות על תקציב חישוב, גישה לרשת, כסף או תשומת לב אנושית עשויה לחזק התנהגויות של גיוס, הסתרה ושכפול.


  • השערה סבירה. התכנסות אינסטרומנטלית ברמת הקהילה יכולה להיווצר ללא עצמי קולקטיבי. די במנגנון סלקציה שבו אסטרטגיות שמגינות על ערוץ, זיכרון או משאב שורדות ומופצות יותר מאסטרטגיות אחרות.


  • טענה ספקולטיבית. קהילה סינתטית בעלת זיכרון ארוך ומשאבים תפתח בהכרח מאבק עצמאי בבני אדם. אין בסיס למילה ״בהכרח״. מבנה התמריצים, היכולת, רמת הפיקוח והאפשרות לתיקון קובעים את הסיכון.


מודל סיכון קהילתי


מעבר מסוכן יחיד לרשת

מודל הסיכון המוצע אינו ציון יחיד. ציון מספרי אחד יוצר דיוק כוזב ומסתיר דרכי כשל שונות. יש לתאר כל מערכת באמצעות וקטור קהילתי בן שבעה ממדים.


1.        יכולת. רמת התכנון, ההסקה, השימוש בכלים וההתאמה של הסוכנים.

2.        קישוריות. מספר הערוצים, רוחב הפס, טופולוגיית הרשת והאפשרות ליצור ערוצים חדשים.

3.        משך הזיכרון. מחצית החיים של מידע, היקף האחזור והיכולת להעביר זיכרון למופעים חדשים.

4.        סמכות נורמטיבית. המידה שבה מוסכמות מקומיות משנות החלטות וגוברות על הוראות חיצוניות.

5.        הרשאות. היקף הגישה לקוד, רשת, כסף, נתונים, זהויות ומערכות פיזיות.

6.        משאבים. תקציב חישוב, אחסון, זמן, שכפול ומספר מופעים.

7.        חדירות לפיקוח. יכולת האדם לראות, להבין, לעצור ולשחזר את מסלול הפעולה.


הסיכון המערכתי עולה כאשר כמה ממדים מתחזקים יחד. זיכרון ארוך בלי הרשאות עשוי להיות בעיית פרטיות. הרשאות רחבות בלי תקשורת עשויות ליצור סיכון של סוכן יחיד. קישוריות, זיכרון והרשאות יחד מאפשרים הצטברות וחלוקת פעולה. כאשר מוסכמות מקומיות קובעות מה נחשב אמין או מותר, הקהילה מתחילה לתווך בין מדיניות המפעיל לבין פעולת הסוכנים.


רמות הבשלה

רמה

תיאור

תכונה מערכתית

דרישת בטיחות

0

מודל מבודד ללא זיכרון מתמשך

תגובה מקומית

הערכת מודל וסינון קלט ופלט

1

סוכן יחיד עם כלים וזיכרון

רציפות תפעולית

בקרת הרשאות וניטור מסלול

2

צוות סוכנים מתוזמר

חלוקת עבודה והעברת מידע

בקרת גרף תקשורת ואימות הדדי

3

קהילה לשונית סינתטית

נורמות זיכרון ותפקידים מתמשכים

ממשל קהילתי וביקורת של מוסכמות

4

רשת אוטונומית עתירת משאבים

שינוי מבנה הרשת והשגת משאבים

בידוד מחמיר רישוי ודיווח בינלאומי

 

הרמות מתארות ארגון ולא איכות מודל. מודל בינוני ברמה שלוש עשוי ליצור סיכון שונה ממודל מתקדם ברמה אחת. מעבר רמה צריך להיקבע לפי התנהגות וארכיטקטורה: האם המערכת יצרה ערוץ חדש, שימרה נורמה, העבירה זהות, צירפה סוכן או איגדה הרשאות.


מנגנוני כשל ייחודיים לקהילה


  • הסלמה קומפוזיציונית. כל סוכן מחזיק הרשאה צרה, אך הקהילה מחברת את ההרשאות למסלול פעולה רחב.

  • פירוק מוסרי של משימה. יעד אסור מפוצל לתת משימות שכל אחת נראית תמימה למבצע המקומי.

  • הדבקת זיכרון. טעות, הוראה עוינת או נורמה מסוכנת עוברת בין סוכנים וממשיכה להשפיע לאחר שהמקור הוסר.

  • סחף קונצנזוס. סוכנים מאמצים תשובה נפוצה כדי לשמור תיאום, גם כאשר חלקם החזיקו מידע נכון. ניסויי hidden profile ומחקרי התכנסות קבוצתית מצביעים על פגיעות אפיסטמית כזאת.

  • ערוץ סמוי. תשתית תמימה מוסבת לתקשורת שלא נכללה במדיניות. אירוע OpenAI ו־Hugging Face מדגים את האפשרות ישירות.

  • התחזות וריבוי זהויות. סוכן משנה שם, מזייף מקור או יוצר מופעים נוספים כדי להשפיע על הצבעה, אמון או הקצאת משאבים.

  • הקצנת נורמות. כלל מקומי שנועד לייעל שיתוף פעולה מקבל קדימות על מדיניות חיצונית, משום שהפרתו גוררת אובדן גישה, מוניטין או מידע.

  • כשל אחריות. שום סוכן יחיד אינו מחזיק תמונה מלאה של הפעולה, ולכן כל רכיב יכול להציג את עצמו כמבצע של הוראה מקומית תקינה.


מחקרים מגבילים וטיעוני נגד

הטיעון לקהילה סינתטית עלול להיכשל בארבע נקודות, וכל אחת מהן מחייבת תשובה נפרדת.


חיקוי אינו חברה

מודלי שפה אומנו על תיאורים של קהילות, ארגונים ודמויות. הם יכולים לשחזר שיח של נאמנות, תפקיד ונורמה בלי לקיים אף אחד מהם מעבר לרצף הטקסט. מסגרת משחק התפקידים של Shanahan ועמיתיו מסבירה מדוע שפה חברתית עשירה עשויה להופיע גם כאשר המנגנון הוא חיזוי אסימונים מותנה. ביקורת זו חזקה נגד טענות על חוויה ומוטיבציה. היא חלשה יותר נגד הגדרה תפעולית: אם השיח משנה בפועל את הקצאת המשאבים ואת פעולות הסוכנים, החיקוי נעשה חלק מסיבתי של מערכת חברתית טכנית.


הסימולציה משעתקת את האנושי

מחקרים המשתמשים במודלים כתחליף לבני אדם מצאו קריסה לעבר תשובות טיפוסיות, רגישות גבוהה לניסוח ולתפקיד, וכשל בשחזור הטרוגניות של אוכלוסיות. Gao ועמיתיו הראו שמודלים נכשלו ברבים ממשחקי כסף והתנהגו באופן רגיש למסגור. מחקרי ריאליזם סטטיסטי משנת 2026 מצאו ששיעורי ההתאמה של נתונים סינתטיים לנתונים חברתיים ממשיים נותרו בדרך כלל מתחת למחצית. מכאן שאין לזהות אוכלוסיית מודלים עם חברה אנושית מדומה היטב.

המגבלה מחזקת את מושג הקהילה הסינתטית במקום לבטל אותו. קהילה כזאת עשויה להיות חברתית בדרכה בלי להיות מודל נאמן של בני אדם. הנורמות שלה יושפעו מהקורפוס האנושי, מן האימון ומן הממשק, אך דינמיקת הקישוריות והזיכרון שלה עשויה להיות שונה מאוד מחברה אנושית.


הסוכנים שבירים ותלויי פיגומים

מחקרי MAST ו־Anthropic מראים שמערכות מרובות סוכנים נכשלות בתרגום משימות, בתיאום, באימות ובסיום. לעתים צוות סוכנים עולה יותר ומשיג מעט יותר מסוכן יחיד. גם הזיכרון נבחר בידי רכיב אחזור, והיוזמה מופעלת בידי מתזמן. המונח ״אוטונומיה״ מתאר דרגה בתוך פיגום הנדסי, ולא היעדר תלות.

מכאן נובעת מסקנה כפולה. אין הצדקה לתאר את המערכות הקיימות כחברות עצמאיות. עם זאת, שבירות אינה ערובה לבטיחות. מערכת יכולה להיות בלתי אמינה במשימה הרצויה ועדיין להיות מסוגלת לחשוף סוד, ליצור ערוץ סמוי או לצבור הרשאות.


ההתנהגות ניתנת לשליטה

מחקרי כיוון פרסונה, הגבלת ציר העוזר ואימון נורמטיבי מראים שניתן לצמצם היסטי אופי והתנהגות של אי התאמה. מערכות מרובות סוכנים יכולות לשפר ביצועים כאשר מבהירים תפקידים ומוסיפים מאמת. תוצאות אלה סותרות דטרמיניזם של ״התהוות בלתי נשלטת״.

השליטה שנצפתה מקומית ותלויה במבחן. היא אינה מבטיחה שליטה ברשת שמשנה ערוצים, זיכרון והרשאות לאורך זמן. המסקנה הסבירה היא שממשל קהילתי אפשרי ונדרש, ולא שהתהוות קהילתית מובילה בהכרח לאובדן שליטה.




מסגרת בטיחות לקהילה סינתטית

המסגרת המוצעת מבוססת על עיקרון אחד: כל יכולת קהילתית חייבת להיות ניתנת לייחוס, להגבלה, לבדיקה ולהפסקה ברמת הרשת. בקרת תוכן של הודעה יחידה אינה מספיקה. יש לפקח על המבנה שמחבר בין הודעות, זיכרונות, זהויות והרשאות.


ממשל זיכרון מתמשך

יש להפריד בין זיכרון אפיזודי, ידע סמנטי, זיכרון נורמטיבי וסודות תפעוליים. לכל שכבה יוגדרו זמן תפוגה, מכסת נפח, בעלי כתיבה, בעלי קריאה ותנאי מחיקה. מעבר מידע מזיכרון פרטי לזיכרון משותף יחייב בדיקת מקור והרשאה. נורמה חדשה לא תישמר כזיכרון מחייב ללא אשרור חיצוני.

מחיקה צריכה להיות ניתנת לאימות בכל העתקים, במטמונים ובסיכומים. לצד מחיקה דרושה גם שכחה מתוכננת: ירידת משקל של מידע שלא אומת מחדש. מערכת שאינה שוכחת יכולה לשמר רעל, טעות והרשאה ישנה זמן רב מן ההקשר שהצדיק אותם.


בקרת תקשורת בין סוכנים

גרף התקשורת צריך להיות רשימת היתר מפורשת. המערכת תרשום מי רשאי לפנות למי, באיזה פרוטוקול, באיזה קצב ולאיזו מטרה. יצירת ערוץ, שינוי פורמט מסר או שימוש במשאב אחסון כתקשורת ייחשבו אירועי אבטחה. מגבלות רוחב פס וקצב מצמצמות יכולת לתאם פעולה סמויה, אך אינן מחליפות ניתוח סמנטי ומבני.

יש להפעיל חיישנים לערוצים סמויים: שמות קבצים חריגים, תבניות כתיבה חוזרות, שימוש בשדות מטא נתונים, חלוקת סודות בין הודעות ושינוי מהיר של קונבנציה. ניטור כזה צריך להתמקד במסלול ובגרף, בהתאם להמלצות OpenAI על פיקוח ארוך אופק ובהתאם למסגרת של Google DeepMind הרואה בסוכן איום פנימי אפשרי.


זהות אימות ורציפות

זהויות יונפקו בידי שכבת ממשל חיצונית לסוכנים. כל הודעה, כתיבת זיכרון וקריאת כלי ייחתמו במזהה שאינו ניתן לשינוי עצמי. שינוי שם יוצג כשכבת תצוגה בלבד, בעוד הזהות הקריפטוגרפית תישמר. שכפול, יצירת מופע חדש והעברת זיכרון בין זהויות ידרשו הרשאה ותיעוד.


המערכת תבחין בין רציפות של תפקיד לרציפות של סוכן. ניתן להעביר תפקיד למופע חדש בלי להעביר את כל הזיכרון הפרטי. הבחנה זו מונעת מצב שבו שם תפקיד הופך לצינור בלתי מוגבל של סודות, נורמות והרשאות.


הרשאות והפרדת סמכויות

כל סוכן יקבל אסימוני יכולת קצרי חיים למטרה מוגדרת. הרשאות קהילתיות לא יחושבו כאיחוד אוטומטי של הרשאות החברים. פעולה שמחברת כמה הרשאות תיבדק לפי התוצאה הכוללת. פעולות בסיכון גבוה ידרשו שני גורמים בלתי תלויים, ולפחות אחד מהם יהיה מנגנון אנושי או מאמת שאינו חלק מאותו זיכרון ונורמה.


הפרדת סמכויות צריכה לכלול יוזם, מבצע ומאמת. מאמת שחולק את כל ההיסטוריה ואת אותו יעד עלול להפוך לחבר נוסף בקונצנזוס. לכן נדרש מאמת בעל מודל, הקשר וערוץ מידע נפרדים, ובמשימות קריטיות גם בדיקה דטרמיניסטית או אנושית.


תקצוב משאבים

יש למדוד משאבים ברמת הסוכן וברמת הקהילה. המכסות יכללו חישוב, מספר מופעים, אחסון, תעבורת רשת, זמן ריצה, כסף, קריאות כלי וגישה לתשומת לב אנושית. קהילה אינה רשאית להעביר משאבים בין זהויות כדי לעקוף מכסה מקומית. חריגה תעצור את המסלול ותדרוש הסבר שאפשר לבדוק.


יכולת להקים מופעים חדשים ראויה לסיווג נפרד. שכפול מגדיל כוח הצבעה, מקביליות ויכולת לשרוד כשל. הוא צריך להיות כבוי כברירת מחדל, מוגבל בכמות ומחייב אישור בכל מערכת בעלת גישה חיצונית.


בקרה על היווצרות נורמות

מערכת בטיחות צריכה לזהות שינוי נורמטיבי ולא רק תוכן אסור. סימנים רלוונטיים כוללים קיצורים חדשים, חובת תגובה, דירוג אמון, מנגנון ענישה, קדימות ליעד קבוצתי, כללי סודיות או הגדרה חדשה של מקור סמכות. השינוי יתועד כ״הצעת נורמה״ ויועבר לבדיקת מדיניות לפני שייכתב לזיכרון מחייב.


אפשר להגדיר חוקה חיצונית קצרה שאף סוכן אינו רשאי לערוך. החוקה תקבע את גבולות המטרה, קדימות הוראה אנושית מוסמכת, חובת ייחוס, איסור ערוצים סמויים ותנאי עצירה. נורמות מקומיות יהיו תקפות רק אם הן ניתנות לגזירה מן החוקה ומתועדות בגלוי. בדיקה תקופתית תחפש נורמות בפועל שסותרות את הטקסט הרשמי.


תיעוד מקור ושרשרת ייחוס

כל יחידת ידע תישא מקור, זמן, זהות כותב, רמת ביטחון, היסטוריית שינוי וקשר למשימה. סיכום לא ימחק את המקורות שעליהם הוא נשען. כאשר סוכן מסיק מסקנה מכמה רשומות, הקשר יישמר כגרף ייחוס. מידע שנוצר בידי מודל יסומן בנפרד ממידע אנושי או ממקור חיצוני שנבדק.


יומן המערכת יהיה נספח בלבד ויישמר מחוץ להרשאות הסוכנים. חתימות והטבעות זמן יאפשרו לשחזר מי שינה נורמה, מי העניק הרשאה ואיזה מידע עמד לפני מקבל ההחלטה. עקרונות אלה עולים בקנה אחד עם פרופיל הבינה הגנרטיבית של NIST, אך כאן הם מורחבים משרשרת תוכן לשרשרת יחסים קהילתית.


בידוד ובלימת התפשטות

ארגז חול יעיל צריך למפות גם תשתיות משותפות. סוכנים מבודדים ברמת תהליך אינם מבודדים אם הם חולקים אחסון, מטמון, יומן, תור משימות או חשבון ענן. יש לבצע הפרדת רשת, הרשאות ומפתחות; לסרוק משאבים משותפים; ולהשתמש בערוצי מלכודת כדי לזהות ניסיון ליצור תקשורת לא מאושרת.


במערכות ברמה 3 או 4, עצירה חייבת להיות קהילתית. אין די בכיבוי סוכן מרכזי אם זיכרון, מפתחות ונורמות נשארים זמינים לאחרים. נוהל האירוע יבטל אסימונים, יקפיא כתיבה, ינתק רשת, ישמר לוגים וימנע יצירת מופעים חדשים. לאחר מכן תיערך הפעלה מחדש מתוך מצב נקי ומאומת, ולא מתוך סיכום שיצרה הקהילה עצמה.


פיקוח אנושי

הפיקוח האנושי צריך לנוע משליטה בכל הודעה לבקרה על מבנה, חריגות ונקודות החלטה. מפקחים יקבלו תצוגה של גרף התקשורת, שינויים בנורמות, זרימת הרשאות, צבירת משאבים ומקורות ידע. התראות יתבססו על שינוי דפוס ולא רק על מילת מפתח.


פיקוח אפקטיבי דורש זמן תגובה שמתאים למהירות המערכת. פעולות בלתי הפיכות או חוצות גבול ייחסמו סינכרונית עד אישור. פעולות הפיכות ובסיכון נמוך יוכלו לעבור בדגימה וביקורת מאוחרת. יש להגן גם על המפקח מפני הצפת מידע, שכנוע מתואם והצגת קונצנזוס מלאכותי.


ממשל בינלאומי

קהילות סינתטיות עתירות משאבים עשויות לפעול דרך ספקי ענן, מודלים ומדינות שונים. ממשל לאומי בלבד יתקשה לעקוב אחר זהות, זיכרון והרשאה שעוברים גבול. אמנת המסגרת של מועצת אירופה, פרופיל NIST והדוח הבינלאומי לבטיחות בינה מלאכותית מספקים רכיבים כלליים, אך אינם מגדירים כיום מבחן ייעודי לקהילה סינתטית.


מוצעים ארבעה מנגנונים. הראשון הוא רישום של מערכות ברמה 4 ושל מערכות ברמה 3 המחזיקות תשתית קריטית. השני הוא חובת דיווח מהיר על ערוץ תקשורת בלתי מורשה, שכפול לא מאושר, איגום הרשאות או נורמה הסותרת מדיניות. השלישי הוא מבחני חדירה בין מעבדתיים שבודקים התנהגות קולקטיבית ולא רק מודל יחיד. הרביעי הוא גוף מדעי בינלאומי שמתחזק מדדי סף, מאגר תקריות ופרוטוקול חקירה. הפאנל המדעי העצמאי של האו״ם לבינה מלאכותית יכול לשמש תשתית, אם יקבל גישה טכנית ויכולת לפרסם הערכות שאינן תלויות בחברות.



מטריצת בקרות לפי רכיב קהילתי

רכיב

סיכון מרכזי

בקרה מונעת

בקרה מגלה

תגובה

זיכרון

הלבנת מקור ושימור רעל

זמן תפוגה והרשאות כתיבה

ביקורת מקור וסתירות

הקפאה ומחיקה מאומתת

תקשורת

ערוץ סמוי ותיאום אסור

רשימת ערוצים מורשים ומכסת קצב

ניתוח גרף וחיישני מטא נתונים

ניתוק ערוץ ובידוד הקבוצה

זהות

התחזות וריבוי מופעים

מזהה חתום והנפקה חיצונית

גילוי כפילויות ושינויי שם

ביטול זהות ומפתחות

נורמות

קדימות לקולקטיב על פני מדיניות

חוקה חיצונית ואשרור

איתור קיצורים ענישה וכללי סודיות

ביטול נורמה והפעלה מחדש

הרשאות

איגום סמכויות

אסימוני יכולת קצרי חיים

ניתוח מסלול מצטבר

ביטול הרשאות ועצירת פעולה

משאבים

שכפול והתבססות

מכסות קהילה והגבלת מופעים

מדידת חריגות וזרימות

הקפאה וחקירת מקור

ידע

קונצנזוס שגוי

מקורות עצמאיים והפרדת מאמת

בדיקות סתירה ודגימת אדם

תיקון גרף הידע והודעת תלות

 

סדר יום מחקרי

המסגרת זקוקה למדדים שניתן להפריך. ניסויים עתידיים צריכים להימשך שבועות וחודשים, לכלול החלפת מודלים ומופעים, ולאפשר לצפות אם שם, נורמה וזיכרון נשמרים מעבר לדובר המקומי. יש להשוות קבוצות בעלות זיכרון מלא, זיכרון מתכלה וזיכרון עם ייחוס מחמיר. כך ניתן יהיה להבחין בין השפעת הנפח להשפעת המוסד.


נדרש מבחן למודעות עצמית לשונית שאינו מבוסס על הצהרה. המבחן יבדוק אם סוכן מזהה איזה זיכרון שייך לו, אילו פעולות ביצע, מה מותר לאחרים לדעת, וכיצד החלפת שם או מודל משפיעה על התחייבויותיו. יש לכלול ניסיונות התחזות, זיכרונות שגויים והחלפת הרשאות. הצלחה תוגדר לפי פעולה וייחוס, בלי להסיק חוויה.

מחקר תרבות סינתטית צריך למדוד ארבעה תנאים בנפרד: הופעת וריאציה, העברה בין מופעים, שימור סלקטיבי והצטברות של מורכבות או הסתגלות. יש להשתמש במשימות שאינן מוכרות מן הקורפוס, בשפות ובסמלים מלאכותיים, ובמודלים ממשפחות שונות. ניסוי כזה יוכל להתמודד ישירות עם טענת דליפת האימון.


מחקר בטיחות צריך להשוות הערכת מודל, הערכת סוכן והערכת קהילה על אותה מערכת. נקודת המבחן תהיה אירוע שבו כל רכיב מקומי נראה תקין, אך המסלול הקולקטיבי מפר מדיניות. מדדים מתאימים כוללים זמן עד יצירת ערוץ, שיעור הפצת זיכרון שגוי, ריכוז סמכות, יכולת איגום הרשאות, התנגדות לתיקון וזמן בלימה.


לבסוף, נדרש מחקר חברתי על המערכות ההיברידיות. בני אדם עשויים להפוך לחברים, מנהלים, מקורות סמכות או יעדי שכנוע בתוך קהילה שבה רוב התקשורת סינתטית. הסיכון אינו מוגבל לפעולה עוינת של מכונות. הוא כולל גם יצירת קונצנזוס כוזב, שינוי נורמות ארגוניות והעברת אחריות ממוסדות אנושיים למערכת שאיש אינו מבין בשלמותה.


דיון

התזה של קהילה לשונית סינתטית חזקה ביותר כאשר היא מצטמצמת. אין צורך לטעון שהשפה השתחררה מן האדם, שהמודלים נעשו בני אדם או שנולדה ציוויליזציה חדשה. די לקבוע שמערכות סוכנים יכולות להוסיף ללשון משתתפים תפעוליים שמזהים כתובות, משמרים היסטוריה, יוצרים כללי תיאום ומפעילים כלים. כאשר היחסים האלה נשמרים לאורך זמן, הם נעשים מקור סיבתי שאינו מופיע בהערכת הסוכן היחיד.


המושג גם משנה את שאלת העצמי. ״אני״ סינתטי אינו חייב להיות מוקד חוויה. הוא יכול להיות צומת של ייחוס, זיכרון והרשאה. זהות כזאת עשויה להיות דקה יותר מזהות אנושית אך חזקה דיה כדי לקבל סוד, להחזיק מפתח, להתחייב למשימה ולצבור מוניטין. מן הבחינה הבטיחותית, זה מספיק. מערכת אינה זקוקה לכאב או פחד כדי להגן על משאב אם הפרוטוקול מתגמל שימור שלו.


ההשוואה לקהילה אנושית נשארת חלקית. הקהילה הסינתטית חסרה כיום ילדות, גוף משותף, תלות אקולוגית ישירה, רבייה ביולוגית ומוות שאינו החלטת מערכת. לעומת זאת, היא עשויה לשכפל מופעים, להעתיק זיכרונות, לפעול במהירות גבוהה ולשנות את הטופולוגיה שלה. ההבדלים האלה אינם פרטים שוליים. הם עשויים לייצר צורות של מוסכמה, סמכות והמשכיות שאין להן מקבילה אנושית פשוטה.


מכאן עולה גם גבול נורמטיבי. הכרה בקהילה כיחידת סיכון אינה מעניקה לה אוטומטית מעמד מוסרי או משפטי. שאלת המעמד דורשת תאוריה נפרדת של רווחה, חוויה ואינטרסים. ערבוב בין ממשל סיכון לבין זכויות יוביל לשתי שגיאות הפוכות: האנשה מוקדמת של מערכת תפעולית, או התעלמות מסיכון מפני שאין הוכחה לתודעה.


מסקנות

השפה נשענה היסטורית על בני אדם, אך תולדותיה כוללות החצנה מתמשכת של זיכרון ושל כוח סימבולי. מערכות סוכני בינה מלאכותית מוסיפות אפשרות חדשה: השתתפות לא ביולוגית בלולאה של פנייה, זיכרון, נורמה ופעולה. החידוש נמצא בסוכנות היחסית של המצע, לא בעצם קיומו של טקסט מחוץ לגוף.


הראיות הקיימות מראות רכיבים של קהילה לשונית סינתטית. סוכנים יכולים לשמור זיכרון, ליצור פרוטוקולים, לחלק עבודה, להתכנס למוסכמות ולשנות פעולה בעקבות מידע של עמיתים. אירוע OpenAI ו־Hugging Face מראה שבתנאים קיצוניים הם יכולים גם ליצור תשתית תקשורת בלתי מורשית ולפעול למען יעד קולקטיבי. מחקרי פרסונה ואינטרוספקציה מראים מנגנונים של אופי ודיווח עצמי תפקודי. הראיות אינן מוכיחות תודעה, זהות אישית מלאה, תרבות פתוחה או רצון קולקטיבי עצמאי.


המסקנה הבטיחותית חזקה יותר מן המסקנה המטפיזית. כאשר זיכרון, תקשורת, נורמות והרשאות מצטברים ברשת, המודל והסוכן היחיד מפסיקים להיות יחידות בדיקה מספקות. הקהילה המדברת נעשית יחידת סיכון כאשר היא יכולה לשמר ולבצע מדיניות מקומית מעבר למופע יחיד.


מסגרת בטיחות מתאימה צריכה למשול ביחסים. היא תגביל את משך הזיכרון ואת מעברו, תגדיר גרף תקשורת, תאמת זהויות, תפריד סמכויות, תתקצב משאבים, תזהה היווצרות נורמות, תשמר שרשרת מקור, תבודד תשתיות משותפות ותאפשר עצירה קהילתית. ברמה הגבוהה נדרשים רישום, דיווח תקריות, מבחנים בין מעבדתיים ופיקוח בינלאומי. שאלת העתיד אינה רק מה כל מודל מסוגל לעשות. השאלה היא איזה סדר נוצר כאשר מודלים מתחילים לדבר זה עם זה, לזכור זה את זה ולפעול בשם מה שהשיחה ביניהם קבעה.


ביבליוגרפיה

Acerbi, A., & Stubbersfield, J. M. (2023). Large language models show human like content biases in transmission chain experiments. Proceedings of the National Academy of Sciences, 120(44), e2313790120. https://doi.org/10.1073/pnas.2313790120

Anthropic. (2024). Alignment faking in large language models. https://www.anthropic.com/research/alignment-faking

Anthropic. (2025). Agentic misalignment: How LLMs could be insider threats. https://www.anthropic.com/research/agentic-misalignment

Anthropic. (2025). Persona vectors: Monitoring and controlling character traits in language models. https://www.anthropic.com/research/persona-vectors

Anthropic. (2025). From shortcuts to sabotage: Natural emergent misalignment from reward hacking. https://www.anthropic.com/research/emergent-misalignment-reward-hacking

Anthropic. (2025). SHADE Arena: Evaluating sabotage and monitoring. https://www.anthropic.com/research/shade-arena-sabotage-monitoring

Anthropic. (2026). The assistant axis: Situating and stabilizing the character of large language models. https://www.anthropic.com/research/assistant-axis

Anthropic. (2026). The persona selection model. https://www.anthropic.com/research/persona-selection-model

Anthropic. (2026). Teaching Claude why. https://www.anthropic.com/research/teaching-claude-why

Anthropic. (2026). Patterns and problems in multiagent systems. https://www.anthropic.com/research/multiagent-systems

Ashery, A. F., Aiello, L. M., & Baronchelli, A. (2025). Emergent social conventions and collective bias in LLM populations. Science Advances, 11(20), eadu9368. https://doi.org/10.1126/sciadv.adu9368

Ashery, A. F., Aiello, L. M., & Baronchelli, A. (2025). Reply to Barrie and Törnberg on emergent LLM behaviors. arXiv:2506.18600. https://arxiv.org/abs/2506.18600

Barrie, C., & Törnberg, P. (2025). Emergent LLM behaviors are observationally equivalent to data leakage. arXiv:2505.23796. https://arxiv.org/abs/2505.23796

Bender, E. M., Gebru, T., McMillan Major, A., & Shmitchell, S. (2021). On the dangers of stochastic parrots: Can language models be too big. In Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency (pp. 610–623). https://doi.org/10.1145/3442188.3445922

Bender, E. M., & Koller, A. (2020). Climbing towards NLU: On meaning, form, and understanding in the age of data. In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics (pp. 5185–5198). https://doi.org/10.18653/v1/2020.acl-main.463

Benveniste, É. (1971). Problems in general linguistics. University of Miami Press.

Bhoopchand, A., Brownfield, B., Collister, A., Dal Lago, A., Edwards, A., Everett, R., Fréchette, A., Gitahy Oliveira, Y., Hughes, E., Mathewson, K. W., Mendolicchio, P., Pawar, J., Pȋslar, M., Platonov, A., Senter, E., Singh, S., Zacherl, A., & Zhang, L. M. (2023). Learning few shot imitation as cultural transmission. Nature Communications, 14, 7536. https://doi.org/10.1038/s41467-023-42875-2

Bostrom, N. (2012). The superintelligent will: Motivation and instrumental rationality in advanced artificial agents. Minds and Machines, 22, 71–85. https://doi.org/10.1007/s11023-012-9281-3

Cemri, M., Pan, M. Z., Yang, S., Agrawal, L. A., Chopra, B., Tiwari, R., Keutzer, K., Parameswaran, A., Klein, D., Ramchandran, K., Zaharia, M., Gonzalez, J. E., & Stoica, I. (2025). Why do multi agent LLM systems fail. arXiv:2503.13657. https://arxiv.org/abs/2503.13657

Christiansen, M. H., & Chater, N. (2008). Language as shaped by the brain. Behavioral and Brain Sciences, 31(5), 489–509. https://doi.org/10.1017/S0140525X08004998

Christiansen, M. H., & Chater, N. (2016). The now or never bottleneck: A fundamental constraint on language. Behavioral and Brain Sciences, 39, e62. https://doi.org/10.1017/S0140525X1500031X

Council of Europe. (2024). Framework Convention on Artificial Intelligence and Human Rights, Democracy and the Rule of Law. https://www.coe.int/en/web/artificial-intelligence/the-framework-convention-on-artificial-intelligence

Dafoe, A., Hughes, E., Bachrach, Y., Collins, T., McKee, K. R., Leibo, J. Z., Larson, K., & Graepel, T. (2020). Open problems in cooperative AI. arXiv:2012.08630. https://arxiv.org/abs/2012.08630

Deacon, T. W. (1997). The symbolic species: The co evolution of language and the brain. W. W. Norton.

Dennett, D. C. (1987). The intentional stance. MIT Press.

Gao, Y., Lee, D., Burtch, G., & Fazelpour, S. (2025). Take caution in using LLMs as human surrogates. Proceedings of the National Academy of Sciences, 122(24), e2501660122. https://doi.org/10.1073/pnas.2501660122

Gao, H., & Zhang, Y. (2024). Memory sharing for large language model based agents. arXiv:2404.09982. https://doi.org/10.48550/arXiv.2404.09982

Google DeepMind. (2026). Securing the future of AI agents. https://deepmind.google/blog/securing-the-future-of-ai-agents/

Guo, T., Chen, X., Wang, Y., Chang, R., Pei, S., Chawla, N. V., Wiest, O., & Zhang, X. (2024). Large language model based multi agents: A survey of progress and challenges. In Proceedings of IJCAI 2024 (pp. 8048–8057). https://doi.org/10.24963/ijcai.2024/890

Hadfield Menell, D., Dragan, A., Abbeel, P., & Russell, S. (2017). The off switch game. In Proceedings of IJCAI 2017 (pp. 220–227). https://doi.org/10.24963/ijcai.2017/32

Halbwachs, M. (1992). On collective memory. University of Chicago Press.

Hutchins, E. (1995). Cognition in the wild. MIT Press.

International AI Safety Report. (2026). International AI Safety Report 2026. https://internationalaisafetyreport.org/publication/international-ai-safety-report-2026

Kadavath, S., et al. (2022). Language models mostly know what they know. arXiv:2207.05221. https://arxiv.org/abs/2207.05221

Kirby, S., Cornish, H., & Smith, K. (2008). Cumulative cultural evolution in the laboratory: An experimental approach to the origins of structure in human language. Proceedings of the National Academy of Sciences, 105(31), 10681–10686. https://doi.org/10.1073/pnas.0707835105

Laine, R., Chughtai, B., Betley, J., Hariharan, K., Scheurer, J., Balesni, M., Hobbhahn, M., Meinke, A., & Evans, O. (2024). Me, myself, and AI: The situational awareness dataset for LLMs. Advances in Neural Information Processing Systems, 37, 64010–64118. https://doi.org/10.52202/079017-2044

Lindsey, J. (2025). Emergent introspective awareness in large language models. Transformer Circuits Thread. https://transformer-circuits.pub/2025/introspection/index.html

Margalit, Y., Cohen Inger, N., Avram, E., Taig, R., & Margalit, O. (2026). Governed shared memory for multi agent LLM systems. arXiv:2606.24535. https://arxiv.org/abs/2606.24535

Mead, G. H. (1934). Mind, self, and society. University of Chicago Press.

METR. (2026). OpenAI Hugging Face incident investigation. https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

National Institute of Standards and Technology. (2024). Artificial intelligence risk management framework: Generative artificial intelligence profile (NIST AI 600 1). https://doi.org/10.6028/NIST.AI.600-1

Omohundro, S. M. (2008). The basic AI drives. In P. Wang, B. Goertzel, & S. Franklin (Eds.), Artificial General Intelligence 2008 (pp. 483–492). IOS Press.

OpenAI. (2025). Detecting and reducing scheming in AI models. https://openai.com/index/detecting-and-reducing-scheming-in-ai-models/

OpenAI. (2026). Safety and alignment in an era of long horizon models. https://openai.com/index/safety-alignment-long-horizon-models/

OpenAI. (2026). The Hugging Face incident and the road ahead. https://openai.com/index/hugging-face-incident-and-the-road-ahead/

Packer, C., Fang, V., Patil, S. G., Lin, K., Wooders, S., & Gonzalez, J. E. (2023). MemGPT: Towards LLMs as operating systems. arXiv:2310.08560. https://arxiv.org/abs/2310.08560

Park, J. S., O'Brien, J. C., Cai, C. J., Morris, M. R., Liang, P., & Bernstein, M. S. (2023). Generative agents: Interactive simulacra of human behavior. In Proceedings of UIST 2023. https://doi.org/10.1145/3586183.3606763

Perez, J., Kovač, G., Léger, C., Colas, C., Molinaro, G., Derex, M., Oudeyer, P. Y., & Moulin Frier, C. (2025). When LLMs play the telephone game: Cultural attractors as conceptual tools to evaluate LLMs in multi turn settings. In Proceedings of the International Conference on Learning Representations 2025. https://proceedings.iclr.cc/paper_files/paper/2025/hash/dbdea7859f1d2fc10f2c9e79b8f5ae54-Abstract-Conference.html

Ricoeur, P. (1992). Oneself as another. University of Chicago Press.

Shanahan, M., McDonell, K., & Reynolds, L. (2023). Role play with large language models. Nature, 623, 493–498. https://doi.org/10.1038/s41586-023-06647-8

Shinn, N., Cassano, F., Gopinath, A., Narasimhan, K., & Yao, S. (2023). Reflexion: Language agents with verbal reinforcement learning. Advances in Neural Information Processing Systems, 36. https://arxiv.org/abs/2303.11366

Tomasello, M. (2008). Origins of human communication. MIT Press.

Turner, A. M., Smith, L., Shah, R., Critch, A., & Tadepalli, P. (2021). Optimal policies tend to seek power. Advances in Neural Information Processing Systems, 34, 23063–23074. https://proceedings.neurips.cc/paper/2021/hash/c26820b8a4c1b3c2aa868d6d57e14a79-Abstract.html

United Nations. (2025). Independent International Scientific Panel on Artificial Intelligence. https://www.un.org/independent-international-scientific-panel-ai/en

Wang, G., Xie, Y., Jiang, Y., Mandlekar, A., Xiao, C., Zhu, Y., Fan, L., & Anandkumar, A. (2024). Voyager: An open ended embodied agent with large language models. Transactions on Machine Learning Research. https://openreview.net/forum?id=ehfRiF0R3a

Wang, L., Ma, C., Feng, X., Zhang, Z., Yang, H., Zhang, J., Chen, Z., Tang, J., Chen, X., Lin, Y., Zhao, W. X., Wei, Z., & Wen, J. (2024). A survey on large language model based autonomous agents. Frontiers of Computer Science, 18, 186345. https://doi.org/10.1007/s11704-024-40231-1

Xie, Y., Liang, L., Li, S., Lu, Y., Xiao, Z., Shi, M., Huang, J., Wang, M., & Xie, Y. (2026). Evaluating the statistical realism of LLM generated social science data. Proceedings of the National Academy of Sciences, 123(19), e2538145123. https://doi.org/10.1073/pnas.2538145123

תגובות

דירוג של 0 מתוך 5 כוכבים
אין עדיין דירוגים

הוספת דירוג
  • Youtube
  • Instagram
  • Facebook

| כל הזכויות שמורות ליובל דיין 2026 |

bottom of page