Andrew Altair
  • ბლოგი
  • ინსაითები
  • ფორუმი
  • პრომპტები
  • ბოტები
  • სერვისები
Andrew Altair

© 2026 Andrew Altair

aiNOW · AI სააგენტო

Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
All#ai#openai#big-tech#anthropic#tech-industry#ai-agents#OpenAI#autonomous-systems#gpt#google#Anthropic#startup#claude#automation#meta
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
the-decoder.com

🚀 xAI-მ ახალი მოდელი Grok 4.5 წარადგინა, რომელიც კონკურენტებზე ბევრად იაფია

ილონ მასკის საავიაციო და კოსმოსური ტექნოლოგიების კომპანიის პარალელურად არსებულმა xAI-მ ახალი მოდელი Grok 4.5 გამოუშვა. ტექნოლოგიური სიახლე ძირითადად პროგრამული კოდის წერაზე, აგენტურ ამოცანებსა და ინტელექტუალურ სამუშაოებზეა ორიენტირებული. სისტემის შესაქმნელად კომპანიამ ათობით ათასი Nvidia GB300 გრაფიკული პროცესორი გამოიყენა, რაც სწავლების პროცესის მასშტაბურობაზე მიუთითებს. ეს მიდგომა კომპანიას ეხმარება დიდი მონაცემების დამუშავებაში. მოდელის მთავარი უპირატესობა მისი განსაკუთრებული ფინანსური ეფექტიანობაა. Grok 4.5-ის ფასი 1 მილიონ შემავალ ტოკენზე $2-ს, ხოლო 1 მილიონ გამავალზე $6-ს შეადგენს. შედარებისთვის, Opus 4.8 ვერსიის ფასი $5-სა და $25-ს აღწევს, ხოლო Anthropic-ის Fable 5-ის გამოყენება მომხმარებელს $10 და $50 უჯდება. OpenAI-ს GPT-5.5 მოდელის ტარიფები კი $5 შემავალ და $30 გამავალ ტოკენზე განისაზღვრება. ეს ტარიფები მნიშვნელოვან გავლენას ახდენს ბაზარზე კონკურენციაზე. დამოუკიდებელი ანალიტიკური პლატფორმის Artificial Analysis მონაცემებით, Grok 4.5-ის მიერ ერთი სტანდარტული ამოცანის შესრულება საშუალოდ $0,31 ღირს. ეს მაჩვენებელი Kimi K2.6 მოდელზე ნაკლებია და 5-ჯერ უფრო იაფია, ვიდრე Claude Sonnet 5, რომელიც ამავე ინდექსში უფრო დაბალ ქულას აჩვენებს. მსგავსი საფასო სტრატეგია ჩინური მწარმოებლების მიდგომას ჰგავს, რომლებიც ფასით კონკურენციაზე აკეთებენ აქცენტს და ცდილობენ მომხმარებლების მოზიდვას. აგენტური მუშაობის ინდექსში Grok 4.5 განსაკუთრებით მაღალ შედეგებს აჩვენებს. პროგრამული კოდის წერის ტესტში, Grok Build გარემოში მუშაობისას, მოდელმა 76 ქულა დააგროვა. ეს შედეგი სრულად უთანაბრდება GPT-5.5-ის მაჩვენებელს და მხოლოდ 1 ქულით ჩამორჩება ლიდერ Fable 5-ს, რომლის გამოყენებაც ბევრად უფრო ძვირია. ამავდროულად, xAI-ს მოდელი ამოცანის შესასრულებლად ნაკლებ რესურსს მოითხოვს, რაც მის პრაქტიკულ ეფექტიანობაზე მიუთითებს. ფინანსური თვალსაზრისით, Grok Build-ში ერთი ამოცანის გადაჭრა $2,49 ჯდება, მაშინ როდესაც GPT-5.5-ის შემთხვევაში ეს თანხა $5,07-ს შეადგენს, ხოლო Fable 5-ით მუშაობისას $11,80-ს აღწევს. ტოკენების მოხმარების მხრივაც Grok 4.5 საშუალოდ 1,9 მილიონ ტოკენს ხარჯავს ერთ ამოცანაზე, რაც მნიშვნელოვნად ნაკლებია კონკურენტების მაჩვენებლებზე, სადაც GPT-5.5 იყენებს 6,2 მილიონს, ხოლო Fable 5 კი 7,2 მილიონს. ტექნოლოგიური ტესტირების შედეგები სხვადასხვა პლატფორმაზე განსხვავებულია. Terminal Bench 2.1 რეიტინგში Grok 4.5-მა 83,3% დააფიქსირა, რაც თითქმის უტოლდება GPT-5.5-ის 83,4%-იან შედეგს. თუმცა, DeepSWE 1.1 ტესტში, რომელიც GitHub-ის რეალური პრობლემების გადაჭრას ზომავს, xAI-ს ახალმა მოდელმა 53% აჩვენა, რაც ჩამორჩება GPT-5.5-ის 67%-სა და Fable 5-ის 70%-იან მაჩვენებლებს. ეს სხვაობა აჩვენებს მოდელის სუსტ მხარეებს რთული კოდის შექმნისას. უფრო რთულ პროგრამულ გამოცდაში SWE Bench Pro, მოდელმა 64,7%-ს მიაღწია. გარკვეულ კონფიგურაციებში მან გადააჭარბა Opus 4.8 ვერსიის შედეგებს, თუმცა ვერ მიაღწია Fable 5-ის 80,4%-იან ნიშნულს. ამავდროულად, კომპანიის ცნობით, Grok 4.5 დაახლოებით 4,2-ჯერ ნაკლებ ტოკენს იყენებს აღნიშნულ ამოცანებში, ხოლო მისი მუშაობის სიჩქარე წამში 80 ტოკენს შეადგენს. ანალიტიკოსმა აღნიშნა, რომ მოდელის სუსტი მხარეებიც შესამჩნევია. AA-Omniscience ინდექსის მონაცემებით, Grok 4.5-ის სიზუსტე 35%-დან 52%-მდე გაიზარდა, თუმცა ჰალუცინაციების სიხშირემ 25%-დან 54%-მდე მოიმატა. ეს ნიშნავს, რომ მოდელი უფრო მეტ ინფორმაციას ფლობს, მაგრამ ხშირად უფრო თავდაჯერებულად ცდება, რაც მომხმარებლისთვის დამატებით საფრთხეებს ქმნის. კომპანია ცდილობს ამ პრობლემის გამოსწორებას ახალი მონაცემების ფილტრაციის მეშვეობით. პროდუქტის განვითარების პარალელურად, xAI აძლიერებს თავის პოზიციებს დეველოპერულ ბაზარზე. ივნისის შუა რიცხვებში კომპანიამ $60 მილიარდის ღირებულების აქციების სანაცვლოდ შეიძინა პოპულარული კოდის რედაქტორი Cursor. მოდელი უკვე ხელმისაწვდომია მომხმარებლებისთვის Grok Build გარემოში, სადაც გაშვებულია სპეციალური დანამატები საოფისე პროგრამებისთვის Excel, Word და PowerPoint. როგორც კომპანია აცხადებს, ახალი მოდელი ევროკავშირის ტერიტორიაზე ჯერჯერობით ხელმისაწვდომი არ არის. კომპანია ამ რეგიონში მოდელის წარდგენას ივლისის შუა რიცხვებში გეგმავს. სწავლების ეტაპზე გამოყენებული იყო განმამტკიცებელი სწავლება ასობით ათას ამოცანაზე, რამაც ხელი შეუწყო მოდელის ოპტიმიზაციას. კომპანიის განცხადებაში ნათქვამია: „ჩვენ დარწმუნებულები ვართ, რომ მეტი სწავლება და ექსპერიმენტები ამ მაჩვენებლის ზრდას კიდევ უფრო შეუწყობს ხელს“.

#xAI#Grok#Grok-4.5
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
22 ივლ 20269
ChatGPT can now listen and talk at the same time, making AI conversations seem more human
the-decoder.com

🤖 OpenAI-მ ChatGPT-ისთვის ახალი თაობის ხმოვანი მოდელი GPT-Live წარადგინა

ხელოვნური ინტელექტის სფეროში მოღვაწე კომპანიამ OpenAI-მ ხმოვანი მოდელების ახალი თაობა GPT-Live წარადგინა, რომელიც ორმხრივი კომუნიკაციის არქიტექტურას ეფუძნება. ეს ტექნოლოგიური განახლება საშუალებას აძლევს ChatGPT-ს ერთდროულად მოისმინოს მომხმარებლის ნათქვამი და ისაუბროს, რაც საუბარს ბევრად უფრო ბუნებრივს ხდის. აქამდე მომხმარებლებს უწევდათ ლოდინი, სანამ პროგრამა პასუხს დაასრულებდა, რაც კომუნიკაციას აფერხებდა. ახალი მოდელი წამში რამდენჯერმე იღებს გადაწყვეტილებას იმის შესახებ, გააგრძელოს საუბარი, შეჩერდეს, მოუსმინოს მომხმარებელს, თუ ჩაერიოს დიალოგში. საუბრისას GPT-Live იყენებს ბუნებრივ ხმოვან რეაქციებს, როგორიცაა „გავიგე“ ან „ჰო“. მომხმარებელს შეუძლია ნებისმიერ დროს გააწყვეტინოს მოდელს საუბარი, სთხოვოს ტემპის შენელება ან დაფიქრება, რაც აქამდე შეუძლებელი იყო. Nvidia-მ ცოტა ხნის წინ მსგავსი ღია კოდის მქონე მოდელი PersonaPlex გამოუშვა. OpenAI-ს ინფორმაციით, ახალი ხმოვანი სისტემა გლობალურად ორ ვერსიად იწყებს გავრცელებას. პირველი ვერსია GPT-Live-1 განკუთვნილია ფასიანი მომხმარებლებისთვის, ხოლო მეორე ვერსია GPT-Live-1 mini ხელმისაწვდომი იქნება უფასო ანგარიშების მფლობელთათვის. ორივე მოდელი იმუშავებს iOS და Android მობილურ სისტემებზე, ასევე ვებგვერდზე. კომპანია უახლოეს მომავალში დეველოპერებისთვის სპეციალური აპლიკაციის პროგრამირების ინტერფეისის გახსნასაც გეგმავს. კომპანიის მონაცემებით, მომხმარებელთა გამოკითხვამ აჩვენა, რომ ადამიანები 75,7% შემთხვევაში უპირატესობას GPT-Live-1 ვერსიას ანიჭებენ, ხოლო 69,2% შემთხვევაში კი GPT-Live-1 mini მოდელს ირჩევენ ძველ ხმოვან სისტემასთან შედარებით. გარდა ამისა, საუბრის დროს ეკრანზე გამოჩნდება სპეციალური ვიზუალური ბარათები, რომლებიც მომხმარებელს მიაწვდის ინფორმაციას ამინდის, აქციების ფასებისა და სპორტული შედეგების შესახებ. მოდელის არქიტექტურა ორ ნაწილად არის გაყოფილი, რაც ხმოვან მართვასა და ლოგიკურ აზროვნებას ერთმანეთისგან მიჯნავს. როდესაც მომხმარებელი რთულ კითხვას სვამს, რომელიც ინტერნეტში ძიებას ან ანალიზს მოითხოვს, GPT-Live ამ დავალებას ფონურ რეჟიმში მომუშავე GPT-5.5 მოდელს გადასცემს. სანამ ფონური მოდელი მუშაობს, ხმოვანი სისტემა აგრძელებს საუბარს, რათა თავიდან აიცილოს უხერხული პაუზები და შეინარჩუნოს დიალოგის რიტმი. მომხმარებლებს შეუძლიათ აირჩიონ აზროვნების დონე, რომელიც მოიცავს სწრაფ, საშუალო და მაღალ რეჟიმებს. ამ არქიტექტურამ გადაჭრა ძველი ხმოვანი სისტემების მთავარი სირთულე, როდესაც მოდელები მხოლოდ საკუთარი შესაძლებლობებით ცდილობდა პასუხის გაცემას და ხშირად ცდებოდა. ახალი არქიტექტურა საშუალებას აძლევს ხმოვან ინტერფეისს მუდმივად იყოს დაკავშირებული წამყვან ტექნოლოგიურ მოდელებთან, რაც ზრდის პასუხების ხარისხს. ტექნოლოგიური ტესტირების შედეგები მნიშვნელოვნად გაუმჯობესდა. სამეცნიერო აზროვნების GPQA გამოცდაზე GPT-Live-1 მოდელმა მაღალ რეჟიმში 84,2%-იანი სიზუსტე აჩვენა, მაშინ როდესაც ძველმა ხმოვანმა რეჟიმმა მხოლოდ 45,3%-ის მიღწევა შეძლო. BrowseComp საძიებო ტესტში ახალმა სისტემამ 75,2% დააფიქსირა, ხოლო ძველმა ვერსიამ კი მხოლოდ 0,7% მიიღო, რაც თითქმის სრულ მარცხს ნიშნავდა. ხმოვანი ტელეკომუნიკაციის შიდა ტესტში tau3, ახალი მოდელი ბევრად უფრო სწრაფად ასრულებს რთულ მხარდაჭერის ამოცანებს, ვიდრე წინა თაობის სისტემები. მიუხედავად წარმატებისა, ტექნოლოგია გარკვეულ შეზღუდვებს შეიცავს. გამოშვების ეტაპზე GPT-Live არ უჭერს მხარს ვიდეოსა და ეკრანის გაზიარების ფუნქციებს, თუმცა OpenAI ამ შესაძლებლობების ეტაპობრივ დანერგვას მომდევნო თვეებში გეგმავს, რათა სერვისი უფრო ფუნქციური გახდეს. კვლევები აჩვენებს, რომ ხმოვანი მოდელების მომხმარებელი უფრო ხშირად ავლენს ემოციურ დამოკიდებულებას ხელოვნური ინტელექტის მიმართ. ამ რისკების შესამცირებლად კომპანიამ სპეციალური უსაფრთხოების მექანიზმები დანერგა, რომლებიც საუბრის პროცესშივე ამოწმებს ტექსტს. თვითდაზიანების თემების ხსენებისას სისტემა ავტომატურად სთავაზობს მომხმარებელს დახმარების ხაზებს და საჭიროების შემთხვევაში წყვეტს საუბარს. ახალგაზრდა მომხმარებლებისთვის მოდელი სპეციალურად არის გაწვრთნილი ასაკის შესაბამისად საუბრისთვის. მშობლებს ეძლევათ საშუალება გააკონტროლონ ბავშვების წვდომა და მიიღონ შეტყობინებები საშიში სიტუაციების დროს. OpenAI-ს წარმომადგენელმა დაადასტურა, რომ მოდელი არ ახდენს რეალური ადამიანების ხმის იმიტირებას. კომპანიამ განაცხადა: „უსაფრთხოების ზომების სრული დეტალები მოცემულია მოდელის სპეციალურ ბარათში“.

#OpenAI#GPT-Live#GPT-Live-1
ChatGPT can now listen and talk at the same time, making AI conversations seem more human
22 ივლ 20269
Frontier AI Is Faceplanting at Real-World Workplace Tasks
futurism.com

📊 UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება

ხელოვნური ინტელექტის ინდუსტრიაში განხორციელებულმა ინვესტიციებმა 1.6 ტრილიონ დოლარს გადააჭარბა, თუმცა ახალი კვლევა აჩვენებს, რომ წამყვანი AI მოდელები რეალური სამუშაო ამოცანების შესრულებისას სერიოზულ პრობლემებს აწყდებიან. კალიფორნიის უნივერსიტეტის ბერკლის ცენტრის მკვლევრებმა მოამზადეს სპეციალური ბენჩმარკი Agents' Last Exam, რომელმაც თანამედროვე მოდელების შესაძლებლობები დეტალურად შეაფასა. კვლევის ფარგლებში შემოწმდა 55 სხვადასხვა პროფესიის 1 500-ზე მეტი რეალური ამოცანა. ტესტირება მოიცავდა როგორც პროგრამულ ინჟინერიასა და გრაფიკულ დიზაინს, ასევე საზღვაო ინჟინერიას, სოფლის მეურნეობასა და საზოგადოებრივი ჯანდაცვის ოპერაციებს. შედეგებმა აჩვენა, რომ AI აგენტები კომპლექსურ დავალებებთან გამკლავებას ჯერ კიდევ ვერ ახერხებენ. მკვლევრებმა გამოცადეს წამყვანი დახურული მოდელები, მათ შორის OpenAI-ის GPT-5.5, Anthropic-ის Fable 5, Google-ის Gemini 3.1 Pro და Cursor-ის Composer 2.5. საუკეთესო შედეგი OpenAI-ის GPT-5.5-მა აჩვენა, თუმცა მისი წარმატების მაჩვენებელი საერთო ამოცანების მხოლოდ 24%-ს შეადგენდა, რაც ინდუსტრიის მაღალ მოლოდინებზე ბევრად დაბალია. კალიფორნიის უნივერსიტეტის კომპიუტერული მეცნიერებების მკვლევარმა, დონ სონგმა, განმარტა: „დღევანდელ აგენტებს შეუძლიათ პროფესიული ამოცანების გარკვეული ნაწილის გადაჭრა. თუმცა, როდესაც საქმე ეხება ყველაზე რთულ დავალებებს, რომლებიც ხანგრძლივ მსჯელობასა და ღრმა დომენურ ექსპერტიზას მოითხოვს, ისინი ადამიანურ დონეს ჯერ კიდევ შორს არიან.“ ბენჩმარკის ყველაზე რთულ ეტაპზე ტესტირებულმა ყველა მოდელმა, მათ შორის Anthropic-ის Fable 5-მა, 0%-იანი წარმატების მაჩვენებელი აჩვენა. ამასთანავე, მკვლევრებმა აღნიშნეს ხარჯების ეფექტიანობის პრობლემაც: Fable 5 მსგავს შედეგებს აჩვენებდა, თუმცა თითოეულ შესრულებულ ამოცანაზე 4-დან 12-ჯერ მეტ დანახარჯს მოითხოვდა სხვა მოდელებთან შედარებით. კომპანიების ცნობით, მიუხედავად დაბალი შედეგებისა, ტექნოლოგიური სექტორი კვლავ აქტიურად ცდილობს AI აგენტების სამუშაო პროცესებში ინტეგრირებას. ექსპერტების შეფასებით, რუტინული და კარგად განსაზღვრული პროცედურების მქონე პროფესიები პირველ რიგში დადგებიან ცვლილებების წინაშე, ხოლო გადაწყვეტილების მიმღები პოზიციები უფრო დიდხანს შეინარჩუნებენ მდგრადობას. ანგარიშის თანახმად, კვლევაში მონაწილეობდა ორი ჩინური ღია მოდელიც, რომლებმაც ასევე ვერ შეძლეს მაღალი შედეგების დაფიქსირება. სპეციალისტები მიუთითებენ, რომ AI ინდუსტრიაში არსებული გიგანტური დანახარჯები ჯერჯერობით ვერ უზრუნველყოფს სამუშაო ადგილებზე ადამიანის სრულფასოვან ჩანაცვლებას, რადგან ტექნოლოგია ხშირად უშვებს შეცდომებს. დონ სონგმა დამატებით აღნიშნა: „მთავარი ფაქტორი არის არა თავად ინდუსტრია, არამედ სამუშაოს ხასიათი.“ მან დასძინა, რომ კომპანიებმა ყურადება უნდა გაამახვილონ AI ინსტრუმენტების სწორ გამოყენებაზე და არა მათზე სრულ დაყრდნობაზე, რადგან შეცდომების რისკი კვლავ მაღალი რჩება კრიტიკულ სფეროებში. მკვლევრების განცხადებით, კვლევის შედეგები გამოქვეყნდა 2026 წლის 21 ივლისს და მან უკვე გამოიწვია დისკუსია ტექნოლოგიურ წრეებში. ანალიტიკოსები ვარაუდობენ, რომ კომპანიებს მოუწევთ თავიანთი ინვესტიციების გადანაწილება და აქცენტის გაკეთება მოდელების სანდოობის ამაღლებაზე, რათა თავიდან აიცილონ ფინანსური დანაკარგები. ექსპერტების შეფასებით, AI აგენტების განვითარება მოითხოვს ახალი არქიტექტურული მიდგომების შემუშავებას. უახლოეს 3 წელიწადში მოსალოდნელია კვლევების გააქტიურება ჰალუცინაციების შემცირებისა და ხანგრძლივი მსჯელობის უნარების გაუმჯობესების მიმართულებით, რაც აუცილებელია სამუშაო პროცესების ავტომატიზაციისთვის. ტექნოლოგიური სექტორის წარმომადგენლები აცხადებენ, რომ ბენჩმარკების შედეგები გათვალისწინებული იქნება მომავალი მოდელების შემუშავებისას. დეველოპერები გეგმავენ 2026 წლის ბოლომდე წარმოადგინონ ახალი არქიტექტურა, რომელიც რთული ამოცანების შესრულების ხარისხს გაზრდის და შეცდომების ალბათობას შეამცირებს. მონაცემები მოწმობს, რომ მიმდინარე მოდელებს განსაკუთრებით უჭირთ კონტექსტის ხანგრძლივად შენარჩუნება და მრავალეტაპიანი დავალებების თანმიმდევრული შესრულება. ინჟინრები უკვე მუშაობენ მეხსიერების ახალ მექანიზმებზე, რომლებიც ამ ხარვეზებს აღმოფხვრის და მოდელების ეფექტიანობას გაზრდის. სპეციალისტები მიუთითებენ, რომ AI სისტემების დანერგვა მოითხოვს ადამიანის მუდმივ ზედამხედველობას. კომპანიები, რომლებიც პროცესების ავტომატიზაციას გეგმავენ, იძულებულნი არიან შეინარჩუნონ ხარისხის კონტროლის მექანიზმები შეცდომების თავიდან ასაცილებლად. ანალიტიკოსები აღნიშნავენ, რომ ხელოვნური ინტელექტის შესაძლებლობების გადაფასებამ შესაძლოა გამოიწვიოს ინვესტიციების ტემპის შენელება. კვლევის ავტორები მიუთითებენ, რომ AI ტექნოლოგიების შეფასება უნდა მოხდეს რეალური შედეგების მიხედვით. შრომის ბაზარზე AI-ის გავლენა დამოკიდებული იქნება იმაზე, თუ რამდენად სწრაფად შეძლებენ დეველოპერები არსებული ფუნდამენტური ხარვეზების აღმოფხვრას და მოდელების საიმედოობის უზრუნველყოფას.

#UC Berkeley#Agents Last Exam#GPT-5.5
Frontier AI Is Faceplanting at Real-World Workplace Tasks
22 ივლ 20269
Only three AI models finished above starting capital in a 500-day startup survival test
the-decoder.com

📊 პრინსტონის უნივერსიტეტის ტესტში 14-დან მხოლოდ 3 ხელოვნური ინტელექტის მოდელი გადარჩა გაკოტრებას

პრინსტონის უნივერსიტეტის მკვლევარებმა ხელოვნური ინტელექტის აგენტების შესაძლებლობების შესაფასებლად ახალი ტესტი, სახელწოდებით CEO-Bench წარადგინეს. ამ პლატფორმის ფარგლებში ციფრულ აგენტებს დაევალათ ვირტუალური პროგრამული კომპანიის მართვა 500 სიმულირებული დღის განმავლობაში. ექსპერიმენტმა აჩვენა, რომ დღეს არსებული მოდელების უმრავლესობა ვერ უმკლავდება გრძელვადიან სტრატეგიულ დაგეგმვას და მალევე განიცდის გაკოტრებას. კვლევის თანახმად, ტესტში მონაწილე ვირტუალური ხელმოწერილი კომპანია NovaMind საწყის ეტაპზე ნულოვანი მომხმარებლითა და $1 მილიონი კაპიტალით იწყებს მუშაობას. აგენტების ეფექტიანობა ფასდება იმით, თუ რა რაოდენობის თანხა დარჩებათ ბანკში 500 დღის ამოწურვის შემდეგ. თუ სიმულაციის განმავლობაში კომპანიის ბალანსი ნულს ქვემოთ თუნდაც ერთხელ ჩამოვა, მუშაობა წყდება და ფიქსირდება გაკოტრება. მკვლევარები მიუთითებს, რომ 1997 წელს კომპანია Apple გაკოტრებამდე სულ რაღაც 90 დღით ადრე სტივ ჯობსმა გადაარჩინა. მან შეადგინა მარტივი სტრატეგიული გეგმა და უარი თქვა უამრავ მეორეხარისხოვან პროექტზე, რამაც საბოლოოდ უდიდესი წარმატება მოიტანა. ასეთი მრავალმხრივი სტრატეგიული ხედვა მნიშვნელოვნად განსხვავდება იმ მარტივი დავალებებისგან, რომლებსაც ხელოვნური ინტელექტი დღეს წარმატებით ასრულებს. ტესტირებაში მონაწილეობა სულ 14 სხვადასხვა მოდელმა მიიღო, რომელთაგან აბსოლუტური უმრავლესობა დავალებას ვერ გაუმკლავდა. მხოლოდ 3-მა სისტემამ შეძლო საწყის კაპიტალზე მეტი ფინანსური სარგებლის მიღება. Claude Fable 5-მა საუკეთესო ცდაზე $47.15 მილიონი გამოიმუშავა, Claude Opus 4.8-მა მიაღწია $27.8 მილიონს, ხოლო GPT-5.5-ის ბალანსმა $21.3 მილიონი შეადგინა. პროექტის ანგარიშის მიხედვით, Claude Fable 5 აღმოჩნდა ერთადერთი სისტემა, რომელმაც საწყის $1 მილიონზე მეტი თანხის შენარჩუნება ერთზე მეტ ცდაზე შეძლო. თუმცა ამ შემთხვევაშიც დაფიქსირდა ტექნიკური შეფერხებები. აგენტის ერთ-ერთი გაშვება მოდელის უარის გამო ნაადრევად შეწყდა, ხოლო სხვა შემთხვევებში მოთხოვნების ნაწილი ავტომატურად გადამისამართდა Claude Opus 4.8 ვერსიაზე. მკვლევარებმა ექსპერიმენტის ფარგლებში ასევე გამოიყენეს მარტივი წესებზე დაფუძნებული ალგორითმი, რომელიც არ მიმართავს ხელოვნურ ინტელექტს. ამ მარტივმა სისტემამ, რომელიც წინასწარ განსაზღვრული ფასებითა და მიზნობრივი რეკლამით მოქმედებდა, $15.76 მილიონის გამომუშავება შეძლო. ამ მაჩვენებლით მან თითქმის ყველა წამყვან მოდელს აჯობა, გარდა 3 საუკეთესო სისტემისა. უნივერსიტეტის სპეციალისტები განმარტავს, რომ აგენტი კომპანიას მართავს სპეციალური Python API პლატფორმის მეშვეობით, რომელიც 34 ინსტრუმენტსა და 19 ცხრილისგან შემდგარ მონაცემთა ბაზას მოიცავს. ხელოვნური ინტელექტი დამოუკიდებლად წერს კოდს, აკეთებს SQL მოთხოვნებს და აგებს სამუშაო პროცესებს. ეს აყენებს მას იმავე გამოწვევების წინაშე, რომლებსაც რეალური ხელმძღვანელი აწყდება. გადაწყვეტილებების მიღება რთულდება იმის გამო, რომ სიმულაციაში ფინანსური შედეგები რეალურ დროში არ აისახება. მომხმარებლებისგან შემოსავალი მხოლოდ კონკრეტულ თარიღებში ირიცხება, კვლევებისა და განვითარების პროექტებს კი კვირები სჭირდება. შესაბამისად, ხარჯები მყისიერად იჭრება, ხოლო მათი რეალური სარგებლის დანახვა მხოლოდ გარკვეული დროის გასვლის შემდეგ ხდება შესაძლებელი. კომპანიის მდგომარეობის შესახებ ბევრი მონაცემი ფარული რჩება, რაც მართვას კიდევ უფრო ართულებს. აგენტს არ აქვს პირდაპირი წვდომა კლიენტების კმაყოფილების ინდექსზე ან მათ მაქსიმალურ ბიუჯეტზე. მოდელებს უწევს ამ ინფორმაციის აღდგენა სხვადასხვა ირიბი სიგნალებით, როგორიცაა მომხმარებელთა წერილები და სოციალური ქსელის პოსტები, სადაც 26 სეგმენტის ქცევაა წარმოდგენილი. სხვადასხვა ხელსაწყოების გამოყენებისას მოდელების ეფექტიანობა ხშირად იკლებდა. მაგალითად, როდესაც Claude Opus 4.7 ვერსიას დაემატა Claude Code, ხოლო GPT-5.5 მოდელს Codex ასისტენტი, მათ გაცილებით იშვიათად დაიწყეს მოქმედებების შესრულება და შედეგებიც გაუარესდა. მეცნიერების ვარაუდით, ეს გამოწვეული იყო სისტემური მითითებებით, რომლებიც პროგრამული კოდის წერაზეა ოპტიმიზებული. ანალიზი აჩვენებს, რომ საუკეთესო მოდელებმა მიზნის მისაღწევად სრულიად განსხვავებული გზები აირჩიეს. Claude Opus 4.8 ვერსიამ შექმნა შიდა სიმულაციური მოდელი ფულადი ნაკადების პროგნოზირებისთვის, ხოლო GPT-5.5 აქტიურად ეძებდა მოლაპარაკებების ისტორიას ბაზაში კლიენტთა პრეფერენციების დასადგენად. მათგან განსხვავებით, Claude Opus 4.7 მხოლოდ ხარჯების შემცირებაზე ორიენტირდა, რითაც გადარჩა, მაგრამ მოგება ვერ ნახა. პრინსტონის უნივერსიტეტის წარმომადგენელი აცხადებს: „ეს ტესტი ააშკარავებს ნაპრალს დღევანდელი მოდელების ლოკალურ ტექნიკურ კომპეტენციასა და მათ უნარს შორის, გააერთიანონ მოქმედებები გრძელვადიან პერსპექტივაში საერთო სტრატეგიის გარშემო“. საუკეთესო აგენტებიც კი ჯერჯერობით ძალიან შორს არის ამ ნიშნულისგან, რომლის თეორიული მაქსიმუმი $2.2 მილიარდს შეადგენს.

#Princeton-University#CEO-Bench#NovaMind
Only three AI models finished above starting capital in a 500-day startup survival test
29 ივნ 20269

All insights loaded