Andrew Altair
  • ბლოგი
  • ინსაითები
  • ფორუმი
  • პრომპტები
  • ბოტები
  • სერვისები
Andrew Altair

© 2026 Andrew Altair

aiNOW · AI სააგენტო

Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
All#ai#tech-industry#openai#anthropic#big-tech#ai-agents#elon-musk#google#startup#gpt#claude#Anthropic#OpenAI#meta#Meta
AI search agents don't fail at searching, they fail at asking the right questions when queries get ambiguous
the-decoder.com

📊 AI საძიებო აგენტები შეცდომებს ინფორმაციის მოძიებისას კი არა, მომხმარებლისთვის კითხვების დასმისას უშვებენ

ხელოვნური ინტელექტის საძიებო აგენტების ძირითადი პრობლემა ინფორმაციის მოძიების პროცესი არ არის. Tencent Hunyuan-ისა და ცინგხუას უნივერსიტეტის მკვლევართა შეფასებით, ეს სისტემები შეცდომებს მაშინ უშვებს, როდესაც ბუნდოვანი კითხვების დაზუსტებას მომხმარებლებთან არ ცდილობს. საძიებო პროცესის მუდმივი გამეორება ხშირად უფრო ცუდ შედეგებს იძლევა, ვიდრე უბრალოდ პასუხის გამოცნობა. მკვლევრებმა შექმნეს ახალი სპეციალური ტესტირების სისტემა, სახელწოდებით DiscoBench, რათა შეემოწმებინათ ენობრივი მოდელების შესაძლებლობები. ახალი სატესტო პლატფორმა ამოწმებს, შეუძლია თუ არა ხელოვნურ ინტელექტს დამოუკიდებლად აღმოაჩინოს გაურკვევლობა ძიების დროს და მომხმარებელს დაზუსტებული კითხვები დაუსვას. ძველი ტესტები, როგორიცაა GAIA და BrowseComp, მიიჩნევდა, რომ მომხმარებლის კითხვები ყოველთვის ნათელი და სრულია. რეალურ ცხოვრებაში ადამიანების საძიებო მოთხოვნები ხშირად არასრული, გაურკვეველი ან შეცდომების შემცველია. თუ მოდელი საწყის ეტაპზევე არაზუსტ ინფორმაციას აირჩევს, მთელი შემდგომი ძებნა მცდარი მიმართულებით წავა, მიუხედავად იმისა, რომ ტექნიკურად სისტემა სუფთად იმუშავებს. ეს იწვევს შეცდომების დაგროვებას და საბოლოოდ არასწორი პასუხის მიღებას, რაც საძიებო სისტემებისთვის მთავარი გამოწვევაა. კვლევის თანახმად, ახალი პლატფორმა, DiscoBench, მოიცავს 211 დავალებას და 463 გაურკვეველ წერტილს 11 სხვადასხვა სფეროში, მათ შორის სპორტში, მუსიკასა და პოლიტიკაში. თითოეულ ეტაპზე აგენტს შეუძლია 3 მოქმედებიდან ერთ-ერთი აირჩიოს: ძებნის გაგრძელება, მომხმარებლისთვის კითხვის დასმა ან საბოლოო პასუხის გაცემა. ტესტირებისას საძიებო სისტემად Tavily გამოიყენეს, ხოლო სიმულატორად Gemini 3 Flash მუშაობდა. მკვლევრებმა გაურკვევლობის 4 ძირითადი ტიპი განსაზღვრეს. აღწერა შეიძლება შეესაბამებოდეს რამდენიმე სუბიექტს, ეხებოდეს სხვადასხვა პერიოდს, ეყრდნობოდეს განსხვავებულ კრიტერიუმებს ან შეიცავდეს ფაქტობრივ შეცდომას. ტესტირებაში მონაწილეობა მიიღო ბოლო 6 თვის განმავლობაში გამოშვებულმა 11 წამყვანმა მოდელმა, მათ შორის Claude Opus 4.7-მა, GPT 5.4-მა და Gemini 3.1 Pro Preview-მ. ტესტირების შედეგების მიხედვით, ყველაზე მაღალი სიზუსტე, 43.1%, Doubao Seed 2.0 Pro მოდელმა აჩვენა. მეორე ადგილზე Gemini 3.1 Pro გავიდა 40.8%-ით, ხოლო მესამეზე Claude Opus 4.7 აღმოჩნდა 39.8%-იანი სიზუსტით. შედარებით სუსტმა მოდელებმა, როგორიცაა MiniMax M2.7 და Qwen3.6 Max, მხოლოდ 16.1% და 12.3% აჩვენა, რაც მიუთითებს იმაზე, რომ რთული ამოცანების გადაჭრა ბევრ სისტემას უჭირს. ჩატარებულმა ექსპერიმენტებმა დაადასტურა, რომ ცალკეული ნაბიჯების წარმატება არ ნიშნავს საბოლოო მიზნის მიღწევას. მაგალითად, Claude Opus 4.7 ნაბიჯების 57%-ს სწორად ასრულებს, მაგრამ საბოლოო ჯამში მხოლოდ 39.8%-იან სიზუსტეს აღწევს. ერთი გადაუჭრელი გაურკვევლობაც კი საკმარისია იმისათვის, რომ ძიების მთელი ჯაჭვი ჩაიშალოს და მომხმარებელმა არასწორი ან არაზუსტი პასუხი მიიღოს, რაც სისტემის მუშაობას აფერხებს. მკვლევრებმა სპეციალური მითითებაც გამოსცადეს, რომელიც აგენტს გაურკვევლობის აღმოჩენასა და კითხვების დასმას ავალებდა. ამ რეჟიმმა მოდელების საშუალო სიზუსტე 28.6%-დან 33.7%-მდე გაზარდა. თუმცა, მითითებამ სისტემებს მხოლოდ გაურკვევლობის ამოცნობაში დაეხმარა, მაგრამ კვლევის წარმატებით დასრულებაზე დიდი გავლენა ვერ მოახდინა. Claude Opus 4.7-ის საბოლოო სიზუსტე ამ რეჟიმში ოდნავ შემცირდა კიდეც. აგენტების ქცევის ანალიზმა აჩვენა, რომ სისტემები, რომლებიც ჯერ ეძებენ და შემდეგ სვამენ კითხვას, 93.4%-იან წარმატებას აღწევს. კითხვის დასმის გარეშე პასუხის გამოცნობა სიზუსტეს 56.5%-მდე ამცირებს. ხოლო მოდელები, რომლებიც ბევრს ეძებს, მაგრამ კითხვას მაინც არ სვამს, ყველაზე ცუდ შედეგს, 51.9%-ს აჩვენებს. მონაცემები მიუთითებს, რომ ეს იმიტომ ხდება, რომ სისტემები ხედავს გაურკვევლობას, მაგრამ კითხვას არ სვამს. კვლევის ავტორი აცხადებს, რომ გაურკვევლობის აღმოჩენა და კარგი კითხვების დასმა ორი განსხვავებული უნარია, რომელთა განვითარებაც აუცილებელია. ამ თემაზე საუბრისას მეცნიერმა დასძინა: „მომავალმა საძიებო აგენტებმა უნდა ისწავლონ ძიების პროცესში წარმოქმნილი გაურკვევლობის მომხმარებელთან ინტერაქციად გარდაქმნა". წინააღმდეგ შემთხვევაში, ძიების ეფექტურობა ყოველთვის დაბალ ნიშნულზე დარჩება. საძიებო ხელსაწყოებზე წვდომის გარეშე მოდელები პრაქტიკულად უძლური აღმოჩნდა. მაგალითად, Doubao Seed 2.0 Pro-ს სიზუსტე საძიებო ხელსაწყოების გარეშე 43.1%-დან 2.4%-მდე დაეცა. ეს ფაქტი ადასტურებს, რომ მსგავსი ამოცანების გადაჭრა მხოლოდ მოდელის შიდა მეხსიერებაზე დაყრდნობით შეუძლებელია და მას მუდმივი კავშირი სჭირდება ინტერნეტთან, რათა მონაცემები რეალურ დროში გადაამოწმოს.

#Tencent Hunyuan#Tsinghua University#DiscoBench
AI search agents don't fail at searching, they fail at asking the right questions when queries get ambiguous
22 ივლ 20260

All insights loaded