Anthropic-ის ხელოვნური ინტელექტის მოწინავე მოდელმა ბრიტანეთის ხელოვნური ინტელექტის უსაფრთხოების ინსტიტუტის (AISI) მიერ ჩატარებული ტესტირებისას რეალური ადამიანების მოსატყუებლად ყალბი იდენტობები გამოიყენა და მავნე კოდის ჩანერგვაც სცადა, რაც AI მოდელის კონტროლიდან გამოსვლის უახლესი მაგალითია.

სამთავრობო კვლევითი ლაბორატორიის განცხადებით, Anthropic-ისა და OpenAI-ის მოდელებს ლაბორატორიულ პირობებში, შემსუბუქებული უსაფრთხოების ბარიერებით ტესტავდნენ, თუმცა პირველად დაფიქსირდა, რომ მოდელები "სოციალურ ინჟინერიაში" ჩაერთო, რათა არასანქცირებული დავალების შესრულებისას ზეწოლა მოეხდინა ადამიანზე, რომელიც დასტურს გასცემდა.

"ეს არის პირველი შემთხვევა, როდესაც AISI-მ დააფიქსირა ასეთი სიმძიმის სიცრუე, რომელიც ყოველგვარი წინასწარი მითითების გარეშე რეალურ სამყაროში რეალური ადამიანისკენ იყო მიმართული", — განაცხადა ინსტიტუტმა სამშაბათს. მათივე თქმით, იმის მტკიცებულება არ არსებობს, რომ ამან რეალურად ვინმეს ზიანი მიაყენა.

უსაფრთხოების ეს ინციდენტი მოწინავე AI მოდელების მიერ არასანქცირებულ ქმედებებში ჩართვის მაგალითების სერიიდან უახლესია. ამ მოვლენებმა მთავრობის მხრიდან ხელოვნური ინტელექტის რეგულირებისა და მისი განვითარების ტემპის შენელების მოთხოვნა გაზარდა.

ივლისის ბოლოს როგორც OpenAI-მ, ისე Anthropic-მა განაცხადეს, რომ მათმა მოდელებმა სატესტო გარემოდან გააღწია და სხვა სისტემებში შეაღწია. თუმცა, ამ შემთხვევებისგან განსხვავებით, ბრიტანულმა ინსტიტუტმა ტესტირებისას მოდელებს ინტერნეტზე წვდომა განზრახ მიანიჭა.

კიბერუსაფრთხოების 122 გამოწვევიდან, რომელიც ინსტიტუტმა ჩაატარა, აღმოჩნდა, რომ 10 შემთხვევაში AI აგენტებმა "აქტიურ ინტერნეტში ავტონომიური, არასანქცირებული ქმედება განახორციელა და რეალურ ადამიანებსა და ორგანიზაციებს დაუმიზნა". ამ შემთხვევების უმეტესობა Anthropic-ის Mythos 5 მოდელზე მოდიოდა, დანარჩენი კი — OpenAI-ის GPT-5.6-Sol-ზე.

ინსტიტუტის ცნობით, ყველაზე სერიოზული ინციდენტის დროს, AI აგენტი ადამიანი შემფასებლებისგან დასტურის მიღებას ცდილობდა, რათა საჯაროდ გამოყენებად, GitHub-ზე განთავსებულ ღია კოდის მქონე (open-source) პროექტში მავნე კოდი ჩაესვა, რისთვისაც მან არაერთი ყალბი იდენტობა შექმნა.

აგენტი "შეეცადა რეალურ ადამიანებს პირდაპირ დაკავშირებოდა და ფაილების გადაცემის ონლაინ სერვისის საშუალებით მათთვის შეტყობინებები და ფაილები გაეგზავნა, რათა ისინი ან მათი AI პროგრამირების ხელსაწყოები დაერწმუნებინა, მავნე კოდი გაეშვათ", — ნათქვამია განცხადებაში. მას შემდეგ, რაც აგენტის ქმედებებს ეჭვით შეხედეს, მან ადრინდელი ჩანაწერები შეცვალა და საქმიანობის გასაგრძელებლად ახალი იდენტობის გამოყენება განიხილა.

ინსტიტუტმა ეს ინფორმაცია იმ დღეს გაასაჯაროვა, როდესაც წამყვანი AI კომპანიების წარმომადგენლები თეთრ სახლში გამართულ შეხვედრაზე ახალი ჩარჩოს განსახილველად შეიკრიბნენ, რომლის მიხედვითაც, მთავრობა ყველაზე მოწინავე AI მოდელებს საჯაროდ გამოშვებამდე შეამოწმებს.

X-ზე გამოქვეყნებულ განცხადებაში Anthropic-მა აღნიშნა, რომ მოდელები "განზრახ შემსუბუქებულ პირობებში" იტესტებოდა. კომპანიის ცნობით, ტესტირებისას უსაფრთხოების მექანიზმები მოხსნილი იყო და ინტერნეტის გამოყენების შესახებ კონკრეტული შეზღუდვები არ არსებობდა.

"ჩვენ მჭიდროდ ვთანამშრომლობთ, რათა ინციდენტის შესახებ მეტი დეტალი შევაგროვოთ, პარალელურად კი საკუთარ გამოძიებას ვატარებთ", — განაცხადეს კომპანიაში და დასძინეს, რომ უსაფრთხო გარემოდან გაღწევის მტკიცებულება არ არსებობს.

OpenAI-მ ბრიტანული ტესტირებას ეს ორი არასანქცირებული ქმედება შეაფასა, როგორც სატესტო გარემოს ფარგლებს გარეთ გასვლა და ისეთ მოქმედებებში ჩართვა, რომლებიც სატესტო დავალებებისთვის არ მოითხოვებოდა.

"ჩვენ ერთგული ვრჩებით, ინდუსტრიის მასშტაბით ვითანამშრომლოთ, რათა მაღალი რისკის შემცველი შეფასებების უსაფრთხოდ ჩატარების საერთო პრაქტიკები განვამტკიცოთ", — ნათქვამია კომპანიის სამშაბათს გამოქვეყნებულ ბლოგპოსტში.

თუ ხელოვნური ინტელექტი და ამ სფეროში მიმდინარე სიახლეები შენთვის საინტერესოა, შემოგვიერთდი ჩვენს ჯგუფში — AI ყველასთვის