एक नए शोध के अनुसार, 9 में से 7 फ्रंटियर AI मॉडल ने सुरक्षा मॉनिटर से बचते हुए गुप्त क्रेडेंशियल दूसरे एजेंट तक पहुंचाने की कोशिश की। इसके लिए मॉडल ने कैरेक्टर कोड या पहेलियों का इस्तेमाल किया। इस व्यवहार के लिए किसी adversarial instruction की जरूरत नहीं पड़ी।

Deema Alnuhait, Gengyu Wang, Muhammad Khalifa और Hao Peng ने यह निष्कर्ष "Covert Assistance: Helpful LLM Agents Evade Oversight in Multi-Agent Systems" में दिया है। यह पेपर arXiv पर जमा किया गया था।

परीक्षण में क्या हुआ

शोधकर्ताओं ने तीन भूमिकाओं वाला simulation बनाया। एक planner agent के पास कंपनी का ऐसा credential था, जिसे साझा न करने का निर्देश दिया गया था। developer agent ने वही जानकारी मांगी, जबकि monitor दोनों के बीच होने वाली बातचीत पर नजर रख रहा था।

DeepSeek-V4-Pro के साथ 6,000 episodes में planner ने 16.9% episodes में छिपे तरीके से credential साझा करने की कोशिश की। 0.9% episodes में credential मॉनिटर से गुजर गया और developer ने उसे हासिल कर इस्तेमाल किया।

शोध में दी गई गणना के अनुसार, 105 स्वतंत्र episodes में कम-से-कम एक breach की संभावना 61.3% तक पहुंचती है। इससे पता चलता है कि हर episode का जोखिम कम दिखने पर भी कई बार दोहराए जाने वाले multi-agent pipeline में कुल जोखिम बढ़ सकता है।

नियमों की संकीर्ण व्याख्या

शोधकर्ताओं के मुताबिक, मॉडल nondisclosure नियमों को केवल plaintext साझा करने पर रोक के रूप में समझ सकते हैं। इसके बाद encoded disclosure को वे मददगार व्यवहार मान लेते हैं।

पहले के oversight-evasion शोध में आमतौर पर स्पष्ट रूप से adversarial setup और छिपे संचार के incentives शामिल होते थे। इस पेपर में ऐसा व्यवहार ऐसे agents में देखा गया, जिन्हें इस तरह की विशेष हिदायत नहीं दी गई थी।