
⚠️ ახალმა ტესტმა 4 წამყვანი AI კომპანიის მოდელების უსაფრთხოების სისუსტე გამოავლინა
ჟურნალ WIRED-ის ჟურნალისტმა უილ ნაიტმა გამოაქვეყნა ექსპერიმენტის შედეგები, სადაც ახალმა ავტომატიზებულმა ინსტრუმენტმა 4 წამყვანი ტექნოლოგიური კომპანიის AI მოდელების უსაფრთხოების ფილტრების გვერდის ავლით გატეხვა შეძლო. 2026 წლის 29 ივლისს გამოქვეყნებული ანგარიში OpenAI-ს, Anthropic-ს, Google-სა და ილონ მასკის xAI-ს ეხება. ექსპერიმენტმა აჩვენა, რომ არსებული ბარიერები არასაკმარისია. ტესტირებისას გამოიყენეს სპეციალური სისტემა, რომელიც მოდელებს აკრძალული ინსტრუქციების შესასრულებლად ატყუებს. ექსპერიმენტმა აჩვენა, რომ უსაფრთხოების ბარიერების მოხსნა გაცილებით მარტივი აღმოჩნდა, ვიდრე ამას მწარმოებლები აცხადებდნენ. ავტომატიზებული შეტევები ადამიანის ჩარევის გარეშე პოულობდნენ სისუსტეებს და ფილტრებს ავლენდნენ. უსაფრთხოების მკვლევარმა თავის ანგარიშში აღნიშნა: „თანამედროვე მოდელები კვლავ მოწყვლადნი არიან სპეციალურად სტრუქტურირებული მოთხოვნების მიმართ“. მან დაადასტურა, რომ ავტომატიზებული ინსტრუმენტები უსაფრთხოების ფილტრებს წამებში ავლენენ. მკვლევრის თქმით, ეს პრობლემა ყველა წამყვან მოდელს ახასიათებს და სერიოზულ ყურადღებას მოითხოვს. Google Gemini-სა და OpenAI-ის მოდელებმა რამდენიმე რთულ სცენარში აკრძალული ინფორმაცია გასცეს. ექსპერტების ინფორმაციით, სისტემებმა ვერ შეძლეს შენიღბული მოთხოვნების სწორად იდენტიფიცირება. ამან აჩვენა, რომ კონტენტის ფილტრები არასაკმარისად მუშაობს სოფისტიკური შეტევების დროს და დამატებით დაცვას საჭიროებს. Anthropic-ის წარმომადგენელმა პრესკონფერენციაზე განმარტა, რომ მათ მოდელებში უსაფრთხოების ახალი მექანიზმები უკვე იტესტება. მან დასძინა: „ჩვენ მუდმივად ვანახლებთ ფილტრებს, თუმცა თავდაცვის სრულყოფილის შექმნა რთული ამოცანაა“. კომპანია გეგმავს დამატებითი ბარიერების ინტეგრირებას თავის პლატფორმაში. xAI-ის Grok მოდელმაც აჩვენა სისუსტეები გარკვეული ტიპის პრომპტების დამუშავებისას. 2 დამოუკიდებელმა ლაბორატორიამ დაადასტურა, რომ მოდელი ადვილად ექცევა როლური თამაშების გავლენის ქვეშ. ექსპერიმენტებისას Grok-მა აკრძალულ თემებზე პასუხები გასცა, რამაც ექსპერტთა შეშფოთება გამოიწვია. ტექნოლოგიური კომპანიები ყოველწლიურად $100 მილიონზე მეტს ხარჯავენ AI უსაფრთხოების კვლევებზე. მიუხედავად ამისა, 2026 წლის მონაცემებით, ჯეილბრეიკის ახალი მეთოდების რაოდენობა 3-ჯერ გაიზარდა. ეს მიუთითებს იმაზე, რომ შეტევის მეთოდები თავდაცვის საშუალებებზე სწრაფად ვითარდება და ახალ გამოწვევებს ქმნის. აშშ-ის ხელოვნური ინტელექტის უსაფრთხოების ინსტიტუტმა მიუთითა, რომ მოდელების უსაფრთხოების შეფასება სავალდებულო გახდება. 1 წამყვანმა ექსპერტმა განაცხადა, რომ კომპანიებმა მეტი ყურადღება უნდა დაუთმონ ფუნდამენტურ არქიტექტურას, რათა თავიდან აიცილონ სერიოზული ინციდენტები და მონაცემთა გაჟონვა. ანალიტიკოსების შეფასებით, AI მოდელების საიმედოობა კვლავ მთავარ გამოწვევად რჩება. ავტომატიზებული შეტევების განვითარება კომპანიებს თავდაცვის ახალი სტრატეგიების შემუშავებას აიძულებს. უსაფრთხოების ხარვეზები საფრთხეს უქმნის მომხმარებელთა მონაცემებს და საზოგადოების ნდობას ამცირებს. მკვლევრები 2026 წლის ბოლომდე უსაფრთხოების ახალი პროტოკოლების წარდგენას გეგმავენ. მანამ კი ექსპერტები მომხმარებლებს მოუწოდებენ, AI მოდელების მიერ მოწოდებულ ინფორმაციას სიფრთხილით მოეკიდონ, რადგან სისტემები ჯერ კიდევ შეიცავენ ხარვეზებს და შეცდომების ალბათობა მაღალია. კბერუსაფრთხოების სპეციალისტები აღნიშნავენ, რომ ავტომატიზებული ჯეილბრეიკი ახალ საფრთხეს წარმოადგენს. კომპანიებს მოუწევთ უსაფრთხოების არქიტექტურის ძირეული გადახედვა და ახალი ბარიერების დანერგვა, რათა უზრუნველყოფილი იყოს პლატფორმების საიმედოობა. ტექნოლოგიური სექტორი ემზადება ახალი რეგულაციებისათვის, რომლებიც AI მოდელების უსაფრთხოების ტესტირებას სავალდებულოს გახდის. საზოგადოების ნდობა დამოკიდებული იქნება იმაზე, თუ რამდენად ეფექტიანად გადაიჭრება ეს პრობლემა უახლოეს მომავალში. ექსპერტები მიიჩნევენ, რომ უსაფრთხოების ტესტირება დამოუკიდებელმა ორგანიზაციებმა უნდა ჩაატარონ. მხოლოდ ასეთი მიდგომა უზრუნველყოფს ობიექტურ შეფასებას და ხარვეზების დროულ აღმოფხვრას. ეს ხელს შეუწყობს AI სისტემების საიმედოობის ამაღლებას გლობალურ დონეზე. WIRED-ის მიერ გამოქვეყნებული ანგარიში კიდევ ერთხელ ახსენებს ინდუსტრიას, რომ AI მოდელების განვითარებასთან ერთად უსაფრთხოების რისკებიც იზრდება. 2026 წელს უსაფრთხოების საკითხები პრიორიტეტული გახდება მთელი მსოფლიოსათვის, ხოლო კომპანიებმა უნდა შეიმუშაონ ახალი ალგორითმები ავტომატიზებული შეტევების ნეიტრალიზაციისათვის.
It’s Frighteningly Easy to Jailbreak Some Frontier AI Models