
🤖 OpenAI-ის ცნობით GPT-5.6 Sol-მა ARC-AGI-3 ტესტში Opus 5-ის შედეგი გაუმჯობესა
OpenAI-ის წარმომადგენლებმა განაცხადეს, რომ ახალმა მოდელმა GPT-5.6 Sol-მა ლოგიკურ ტესტ ARC-AGI-3-ში 38.3% დააგროვა და Anthropic-ის მოდელ Opus 5-ის 30.2%-იან შედეგს გადააჭარბა. ტექნოლოგიურმა გიგანტმა ეს მონაცემები 2026 წლის 30 ივლისს გამოაქვეყნა, თუმცა გამოქვეყნებულმა ციფრებმა ინდუსტრიის ექსპერტებში დიდი ვნებათაღელვა გამოიწვია. 38.3%-იანი მაჩვენებელი ლოგიკური აზროვნების ბენჩმარკებში ახალ რეკორდად ითვლება. საქმე ის არის, რომ OpenAI-ს ოფიციალური სატესტო გარემო არ გამოუყენებია და მოდელი საკუთარი სისტემით გამოცადა. ოფიციალურ სატესტო პლატფორმაზე GPT-5.6 Sol-მა მხოლოდ 7.8% აჩვენა, რაც დაწესებულ სტანდარტებზე ბევრად დაბალია. ამ განსხვავებამ 2 სატესტო გარემოს შორის სპეციალისტების გაოცება გამოიწვია. ოფიციალურ გარემოში მოდელის მსჯელობის ჯაჭვი ყოველი მოქმედების შემდეგ იშლებოდა. OpenAI-ის ინჟინერმა თავის ანგარიშში აღნიშნა: „მოდელის შესაძლებლობები დამოკიდებულია არა მხოლოდ არქიტექტურაზე, არამედ სატესტო გარემოს პარამეტრებზე“. კომპანიის განმარტებით, შედეგის სამჯერ გაზრდა Responses API-ს ორმა ახალმა პარამეტრმა უზრუნველყო. ამ ფუნქციებმა მოდელს რთული ლოგიკური დავალებების შესრულება და კონტექსტის შენარჩუნება მნიშვნელოვნად გაუადვილა. პირველ ფუნქციას Retained Reasoning ეწოდება, რომელიც ყოველი ნაბიჯის შემდეგ მსჯელობის პროცესს ინახავს. ოფიციალურ სატესტო გარემოში ეს აზრობრივი ჯაჭვი ყოველი მოქმედების შემდეგ იშლება, რაც მოდელს ყოველ ჯერზე ნულიდან აიძულებს ფიქრის დაწყებას. OpenAI-ის სისტემა კი ამ ინფორმაციას უწყვეტად ინარჩუნებს, რაც რთული ამოცანების ამოხსნაში ეხმარება. მეორე ფუნქციამ, რომელსაც Compaction ეწოდება, ძველი კონტექსტის ეფექტიანი შეჯამება უზრუნველყო. სტანდარტული სისტემები ძველ ტექსტს უბრალოდ ჭრიან, ხოლო Compaction-ი მნიშვნელოვან დეტალებს აჯამებს. ამ მიდგომამ ინფორმაციის დაკარგვის გარეშე მეხსიერების ოპტიმიზაცია გახადა შესაძლებელი, რამაც 38.3%-იან შედეგამდე მიიყვანა სისტემა. ARC Prize-ის ორგანიზატორებმა დაადასტურეს, რომ ოფიციალური შეფასება სტანდარტულ გარემოს მოითხოვს. ორგანიზაციის წარმომადგენელმა განმარტა: „ჩვენი მიზანია მოდელების სუფთა შესაძლებლობები შევაფასოთ პროვაიდერების სპეციალური დამატებების გარეშე“. მათი თქმით, მხოლოდ ასეთი მიდგომა უზრუნველყოფს სამართლიან შედარებას ყველა მოდელს შორის. Anthropic-ის მოდელმა Opus 5-მა თავისი 30.2%-იანი შედეგი ყოველგვარი დამხმარე ინსტრუმენტების გარეშე დააფიქსირა. ამ მოდელმა Fable 5-ისა და წინა თაობის სისტემების მაჩვენებლები 4-ჯერ გააუმჯობესა. შესაბამისად, ოფიციალურ ლიდერბორდზე პირველ ადგილს კვლავ Anthropic-ის პლატფორმა ინარჩუნებს, რადგან მისი შედეგი სტანდარტულ გარემოში დაფიქსირდა. OpenAI-ის სპეციალისტები აცხადებენ, რომ ოფიციალური სატესტო სისტემა ძველ Chat Completions API-ს იყენებდა. მათი ინფორმაციით, ეს ინტერფეისი მოკლებული იყო იმ შესაძლებლობებს, რაც Claude-ის API-ს თავიდანვე გააჩნდა. კომპანიაში მიიჩნევენ, რომ ძველი API-ით ტესტირება მოდელს უსამართლო პირობებში აყენებდა და რეალურ პოტენციალს არ ასახავდა. ტექნოლოგიური ანალიტიკოსების შეფასებით, ბენჩმარკების ობიექტური შეფასება სულ უფრო რთული ხდება. 38.3%-იანი მაჩვენებელი აჩვენებს, თუ რამხელა მნიშვნელობა აქვს პროგრამულ გარემოს. ექსპერტები დასძენენ, რომ მომავალში ხელოვნური ინტელექტის შეფასებისას გარემოს პარამეტრების მკაცრი სტანდარტიზაცია გახდება საჭირო, რათა შედეგები ობიექტური იყოს. მკვლევრები 2026 წლის ბოლომდე ARC-AGI-3-ის ახალი წესების გამოქვეყნებას გეგმავენ. სატესტო სისტემების განახლება ხელოვნური ინტელექტის შეფასებას უფრო ობიექტურს გახდის. მანამდე კი დებატები იმის შესახებ, თუ რომელ მოდელს აქვს რეალური ლოგიკური უპირატესობა, ტექნოლოგიურ საზოგადოებაში აქტიურ ფაზაში რჩება. OpenAI-ის ბოლო ანგარიშში ასევე ნათქვამია, რომ ChatGPT Pro-ს მომხმარებლებისათვის 3 ახალი ვარიანტი მომზადდება. ეს იქნება პირველი სერიოზული ცვლილება პრო-პაკეტის სტრუქტურაში მისი ჩაშვების შემდეგ. კომპანია გეგმავს ახალი არქიტექტურის კომერციულ პლატფორმებში ინტეგრირებას. სატესტო გარემოების ირგვლივ წამოჭრილი დისკუსია აჩვენებს, რომ AI-ის შეფასების კრიტერიუმები ტრანსფორმაციას განიცდის. ინდუსტრიის ლიდერები შეთანხმდნენ, რომ მომავალი ბენჩმარკები გაითვალისწინებენ როგორც მოდელის ალგორითმებს, ისე გარემოს პროგრამულ შესაძლებლობებს. ტექნოლოგიური სექტორის მკვლევრები ყურადებას ამახვილებენ იმ გარემოებაზე, რომ ლოგიკური აზროვნების ტესტები მოდელების პრაქტიკულ ეფექტიანობას განსაზღვრავს. 38.3%-იანი მაჩვენებელი ადასტურებს, რომ პროგრამული გარემოს სწორი კონფიგურაცია AI მოდელების პოტენციალს მნიშვნელოვნად ზრდის. საბოლოო ჯამში, GPT-5.6 Sol-ის შედეგები აჩვენებს, რომ ხელოვნური ინტელექტის შეფასება კომპლექსური პროცესია. OpenAI და Anthropic განაგრძობენ ბრძოლას ტექნოლოგიურ ლიდერობაზე.
OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 with its latest API and two additional settings