Andrew Altair
  • ბლოგი
  • ინსაითები
  • ფორუმი
  • პრომპტები
  • ბოტები
  • სერვისები
Andrew Altair

© 2026 Andrew Altair

aiNOW · AI სააგენტო

Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
All#ai#tech-industry#openai#anthropic#big-tech#ai-agents#elon-musk#google#startup#gpt#claude#Anthropic#OpenAI#meta#Meta
Frontier AI Is Faceplanting at Real-World Workplace Tasks
futurism.com

📊 UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება

ხელოვნური ინტელექტის ინდუსტრიაში განხორციელებულმა ინვესტიციებმა 1.6 ტრილიონ დოლარს გადააჭარბა, თუმცა ახალი კვლევა აჩვენებს, რომ წამყვანი AI მოდელები რეალური სამუშაო ამოცანების შესრულებისას სერიოზულ პრობლემებს აწყდებიან. კალიფორნიის უნივერსიტეტის ბერკლის ცენტრის მკვლევრებმა მოამზადეს სპეციალური ბენჩმარკი Agents' Last Exam, რომელმაც თანამედროვე მოდელების შესაძლებლობები დეტალურად შეაფასა. კვლევის ფარგლებში შემოწმდა 55 სხვადასხვა პროფესიის 1 500-ზე მეტი რეალური ამოცანა. ტესტირება მოიცავდა როგორც პროგრამულ ინჟინერიასა და გრაფიკულ დიზაინს, ასევე საზღვაო ინჟინერიას, სოფლის მეურნეობასა და საზოგადოებრივი ჯანდაცვის ოპერაციებს. შედეგებმა აჩვენა, რომ AI აგენტები კომპლექსურ დავალებებთან გამკლავებას ჯერ კიდევ ვერ ახერხებენ. მკვლევრებმა გამოცადეს წამყვანი დახურული მოდელები, მათ შორის OpenAI-ის GPT-5.5, Anthropic-ის Fable 5, Google-ის Gemini 3.1 Pro და Cursor-ის Composer 2.5. საუკეთესო შედეგი OpenAI-ის GPT-5.5-მა აჩვენა, თუმცა მისი წარმატების მაჩვენებელი საერთო ამოცანების მხოლოდ 24%-ს შეადგენდა, რაც ინდუსტრიის მაღალ მოლოდინებზე ბევრად დაბალია. კალიფორნიის უნივერსიტეტის კომპიუტერული მეცნიერებების მკვლევარმა, დონ სონგმა, განმარტა: „დღევანდელ აგენტებს შეუძლიათ პროფესიული ამოცანების გარკვეული ნაწილის გადაჭრა. თუმცა, როდესაც საქმე ეხება ყველაზე რთულ დავალებებს, რომლებიც ხანგრძლივ მსჯელობასა და ღრმა დომენურ ექსპერტიზას მოითხოვს, ისინი ადამიანურ დონეს ჯერ კიდევ შორს არიან.“ ბენჩმარკის ყველაზე რთულ ეტაპზე ტესტირებულმა ყველა მოდელმა, მათ შორის Anthropic-ის Fable 5-მა, 0%-იანი წარმატების მაჩვენებელი აჩვენა. ამასთანავე, მკვლევრებმა აღნიშნეს ხარჯების ეფექტიანობის პრობლემაც: Fable 5 მსგავს შედეგებს აჩვენებდა, თუმცა თითოეულ შესრულებულ ამოცანაზე 4-დან 12-ჯერ მეტ დანახარჯს მოითხოვდა სხვა მოდელებთან შედარებით. კომპანიების ცნობით, მიუხედავად დაბალი შედეგებისა, ტექნოლოგიური სექტორი კვლავ აქტიურად ცდილობს AI აგენტების სამუშაო პროცესებში ინტეგრირებას. ექსპერტების შეფასებით, რუტინული და კარგად განსაზღვრული პროცედურების მქონე პროფესიები პირველ რიგში დადგებიან ცვლილებების წინაშე, ხოლო გადაწყვეტილების მიმღები პოზიციები უფრო დიდხანს შეინარჩუნებენ მდგრადობას. ანგარიშის თანახმად, კვლევაში მონაწილეობდა ორი ჩინური ღია მოდელიც, რომლებმაც ასევე ვერ შეძლეს მაღალი შედეგების დაფიქსირება. სპეციალისტები მიუთითებენ, რომ AI ინდუსტრიაში არსებული გიგანტური დანახარჯები ჯერჯერობით ვერ უზრუნველყოფს სამუშაო ადგილებზე ადამიანის სრულფასოვან ჩანაცვლებას, რადგან ტექნოლოგია ხშირად უშვებს შეცდომებს. დონ სონგმა დამატებით აღნიშნა: „მთავარი ფაქტორი არის არა თავად ინდუსტრია, არამედ სამუშაოს ხასიათი.“ მან დასძინა, რომ კომპანიებმა ყურადება უნდა გაამახვილონ AI ინსტრუმენტების სწორ გამოყენებაზე და არა მათზე სრულ დაყრდნობაზე, რადგან შეცდომების რისკი კვლავ მაღალი რჩება კრიტიკულ სფეროებში. მკვლევრების განცხადებით, კვლევის შედეგები გამოქვეყნდა 2026 წლის 21 ივლისს და მან უკვე გამოიწვია დისკუსია ტექნოლოგიურ წრეებში. ანალიტიკოსები ვარაუდობენ, რომ კომპანიებს მოუწევთ თავიანთი ინვესტიციების გადანაწილება და აქცენტის გაკეთება მოდელების სანდოობის ამაღლებაზე, რათა თავიდან აიცილონ ფინანსური დანაკარგები. ექსპერტების შეფასებით, AI აგენტების განვითარება მოითხოვს ახალი არქიტექტურული მიდგომების შემუშავებას. უახლოეს 3 წელიწადში მოსალოდნელია კვლევების გააქტიურება ჰალუცინაციების შემცირებისა და ხანგრძლივი მსჯელობის უნარების გაუმჯობესების მიმართულებით, რაც აუცილებელია სამუშაო პროცესების ავტომატიზაციისთვის. ტექნოლოგიური სექტორის წარმომადგენლები აცხადებენ, რომ ბენჩმარკების შედეგები გათვალისწინებული იქნება მომავალი მოდელების შემუშავებისას. დეველოპერები გეგმავენ 2026 წლის ბოლომდე წარმოადგინონ ახალი არქიტექტურა, რომელიც რთული ამოცანების შესრულების ხარისხს გაზრდის და შეცდომების ალბათობას შეამცირებს. მონაცემები მოწმობს, რომ მიმდინარე მოდელებს განსაკუთრებით უჭირთ კონტექსტის ხანგრძლივად შენარჩუნება და მრავალეტაპიანი დავალებების თანმიმდევრული შესრულება. ინჟინრები უკვე მუშაობენ მეხსიერების ახალ მექანიზმებზე, რომლებიც ამ ხარვეზებს აღმოფხვრის და მოდელების ეფექტიანობას გაზრდის. სპეციალისტები მიუთითებენ, რომ AI სისტემების დანერგვა მოითხოვს ადამიანის მუდმივ ზედამხედველობას. კომპანიები, რომლებიც პროცესების ავტომატიზაციას გეგმავენ, იძულებულნი არიან შეინარჩუნონ ხარისხის კონტროლის მექანიზმები შეცდომების თავიდან ასაცილებლად. ანალიტიკოსები აღნიშნავენ, რომ ხელოვნური ინტელექტის შესაძლებლობების გადაფასებამ შესაძლოა გამოიწვიოს ინვესტიციების ტემპის შენელება. კვლევის ავტორები მიუთითებენ, რომ AI ტექნოლოგიების შეფასება უნდა მოხდეს რეალური შედეგების მიხედვით. შრომის ბაზარზე AI-ის გავლენა დამოკიდებული იქნება იმაზე, თუ რამდენად სწრაფად შეძლებენ დეველოპერები არსებული ფუნდამენტური ხარვეზების აღმოფხვრას და მოდელების საიმედოობის უზრუნველყოფას.

#UC Berkeley#Agents Last Exam#GPT-5.5
Frontier AI Is Faceplanting at Real-World Workplace Tasks
22 ივლ 20260

All insights loaded