Andrew Altair
  • ბლოგი
  • ინსაითები
  • ფორუმი
  • პრომპტები
  • ბოტები
  • სერვისები
Andrew Altair

© 2026 Andrew Altair

aiNOW · AI სააგენტო

Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
All#ai#openai#big-tech#anthropic#tech-industry#ai-agents#OpenAI#autonomous-systems#gpt#google#Anthropic#startup#claude#automation#meta
⚡ SpaceXAI-მ ახალი მოდელი Grok 4.6 წარადგინა და ფასი 60%-ით შეამცირა
andrewaltair.ge

⚡ SpaceXAI-მ ახალი მოდელი Grok 4.6 წარადგინა და ფასი 60%-ით შეამცირა

SpaceXAI-მ ახალი ფლაგმანური მოდელი Grok 4.6 წარადგინა, რომელიც წამყვან კონკურენტებს შესაძლებლობებით გაუტოლდა. Artificial Analysis-ის ინდექსში ახალმა სისტემამ 61 ქულა დააგროვა და OpenAI-ს GPT-5.6 Sol მოდელის შედეგი გაამეორა. მასზე მაღალი ქულა მხოლოდ Anthropic-ის Claude Opus 5-ს (63) და Claude Fable 5-ს (62) აქვს. ახალმა მოდელმა წინა ვერსიას, Grok 4.5-ს, 5 ქულით გადაასწრო. განსაკუთრებით მაღალი შედეგები ავტონომიური დავალებების შესრულებაში დაფიქსირდა. კომპიუტერულ სამუშაო ინდექსში GDPval-AA v2 მოდელმა 1 753 Elo ქულა მიიღო და მე-2 ადგილი დაიკავა. საერთაშორისო დამკვირვებლები პროცესებს ყურადღებით ადევნებს თვალს, რადგან მიღებული გადაწყვეტილებები ინდუსტრიის მომავალზე პირდაპირ მოქმედებს. Grok 4.6 რთულ ამოცანებს საშუალოდ 53 ნაბიჯში ასრულებს. შედარებისთვის, Claude Opus 5-ს იმავე დავალებისთვის 103 ნაბიჯი სჭირდება. SpaceXAI-ს წარმომადგენელმა განმარტა, რომ ახალი ალგორითმი რესურსებს უფრო ეფექტიანად იყენებს. ბაზრის ანალიტიკოსები დამატებით წინსვლას უახლოეს თვეებში ელოდება, რადგან ახალი სტანდარტები სექტორში უკვე მკვიდრდება. კომპანიამ საფასო პოლიტიკა უცვლელი დატოვა და 1 მილიონ ტოკენზე $2 და $6 დააწესა. ეს მაჩვენებელი 60%-ით იაფია Claude Opus 5-ის ($5/$25) და GPT-5.6 Sol-ის ($5/$30) ტარიფებზე. SpaceXAI-ს წარმომადგენელმა დაადასტურა: „ჩვენი მიზანი მაღალი წარმადობის ხელმისაწვდომ ფასად უზრუნველყოფაა”. სპეციალისტების შეფასებით, მიღწეული შედეგები გრძელვადიან პერსპექტივას ქმნის და ტექნოლოგიურ პროგრესს დამატებით იმპულსს აძლევს. Grok 4.6 უკვე ხელმისაწვდომია API-ს, Cursor-ის, Grok Build-ის და პარტნიორი პლატფორმების მეშვეობით, როგორიცაა OpenRouter, Vercel და Cloudflare. პირველი 1 კვირის განმავლობაში დეველოპერები 2-ჯერ გაორმაგებულ ლიმიტებს მიიღებს. დამოუკიდებელი აუდიტორები აღნიშნავს, რომ უსაფრთხოებისა და ეფექტიანობის ბალანსი ინდუსტრიის მთავარ გამოწვევად რჩება. ბაზრის ანალიტიკოსების შეფასებით, ფასების მკვეთრი შემცირება კონკურენციას გაამწვავებს. OpenAI და Anthropic იძულებული გახდება, საკუთარი ტარიფები გადასინჯოს ან მოდელების ეფექტიანობა გაზარდოს. კვლევითი ცენტრების მონაცემებით, ტექნოლოგიური ინოვაციების ტემპი 2025 წელთან შედარებით 2-ჯერ გაიზარდა, რაც ახალ რეგულაციებს მოითხოვს. ტექნოლოგიური სექტორი Grok 4.6-ის გამოჩენას დადებითად აფასებს. დეველოპერებს საშუალება ეძლევა, მძლავრი AI ინსტრუმენტები დაბალ ფასად გამოიყენოს. 2026 წლის ბოლომდე ახალი განახლებები იგეგმება. ტექნოლოგიური სექტორის ექსპერტები ყურადღებით აკვირდება მოვლენების განვითარებას. 2026 წლის განმავლობაში განხორციელებული ინვესტიციები 100 მილიარდ დოლარს აჭარბებს. SpaceXAI მომავალ თვეებში ინფრასტრუქტურის გაფართოებას გეგმავს. კომპანიამ აღნიშნა, რომ ახალი მოდელების შემუშავება კიდევ უფრო სწრაფი ტემპით გაგრძელდება. საერთაშორისო დამკვირვებლები პროცესებს ყურადღებით ადევნებს თვალს, რადგან მიღებული გადაწყვეტილებები ინდუსტრიის მომავალზე პირდაპირ მოქმედებს. საერთაშორისო დამკვირვებლები პროცესებს ყურადღებით ადევნებს თვალს, რადგან მიღებული გადაწყვეტილებები ინდუსტრიის მომავალზე პირდაპირ მოქმედებს. ინდუსტრიის ექსპერტები ვარაუდობს, რომ ახალი მოდელი ბაზარზე ფასების ახალ სტანდარტს დაამკვიდრებს. დეველოპერების აქტივობა უკვე გაიზარდა. ბაზრის ანალიტიკოსები დამატებით წინსვლას უახლოეს თვეებში ელოდება, რადგან ახალი სტანდარტები სექტორში უკვე მკვიდრდება. ბაზრის ანალიტიკოსები დამატებით წინსვლას უახლოეს თვეებში ელოდება, რადგან ახალი სტანდარტები სექტორში უკვე მკვიდრდება. დეველოპერული საზოგადოება ახალ შესაძლებლობებს აქტიურად ტესტავს. 2026 წლის ბოლომდე Grok 4.6-ის ბაზაზე ასობით ახალი აპლიკაცია შეიქმნება. სპეციალისტების შეფასებით, მიღწეული შედეგები გრძელვადიან პერსპექტივას ქმნის და ტექნოლოგიურ პროგრესს დამატებით იმპულსს აძლევს. SpaceXAI აცხადებს, რომ მოდელის გაუმჯობესებაზე მუშაობა უწყვეტ რეჟიმში გაგრძელდება, რათა ლიდერობა შენარჩუნდეს. დამოუკიდებელი აუდიტორები აღნიშნავს, რომ უსაფრთხოებისა და ეფექტიანობის ბალანსი ინდუსტრიის მთავარ გამოწვევად რჩება. ტექნოლოგიური სექტორის ექსპერტები ყურადღებით აკვირდება მოვლენების განვითარებას. 2026 წლის განმავლობაში განხორციელებული ინვესტიციები 100 მილიარდ დოლარს აჭარბებს. კვლევითი ცენტრების მონაცემებით, ტექნოლოგიური ინოვაციების ტემპი 2025 წელთან შედარებით 2-ჯერ გაიზარდა, რაც ახალ რეგულაციებს მოითხოვს. ტექნოლოგიური სექტორის ექსპერტები ყურადღებით აკვირდება მოვლენების განვითარებას. 2026 წლის განმავლობაში განხორციელებული ინვესტიციები 100 მილიარდ დოლარს აჭარბებს.

#SpaceXAI#Grok-4.6#GPT-5.6-Sol
⚡ SpaceXAI-მ ახალი მოდელი Grok 4.6 წარადგინა და ფასი 60%-ით შეამცირა
13 აგვ 20265
Cursor's agent swarm suggests cheaper models can handle most coding when frontier models plan the work
the-decoder.com

💻 Cursor-ის ახალი აგენტური სისტემა აჩვენებს, რომ იაფ მოდელებს კოდირების შესრულება ეფექტიანად შეუძლია

პროგრამირების AI-ასისტენტმა Cursor-მა 2026 წელს თავისი განახლებული აგენტური სისტემა გამოსცადა და შთამბეჭდავი შედეგები მიიღო. ექსპერიმენტმა აჩვენა, რომ ძვირადღირებული ფლაგმანური მოდელების გამოყენება მხოლოდ დაგეგმვის ეტაპზეა საჭირო, ხოლო უშუალო კოდირება იაფ მოდელებს წარმატებით ენდობა. ეს მიდგომა დეველოპერულ ხარჯებს მნიშვნელოვნად ამცირებს და პროცესს აჩქარებს. ინდუსტრიაში ახალი შესაძლებლობები ჩნდება, რაც ინოვაციების სტიმულირებას ახდენს. The Decoder-ის ჟურნალისტის, ჯონათან კემპერის, სტატიაში აღწერილია 1 მნიშვნელოვანი ექსპერიმენტის დეტალები. Cursor-მა აგენტების ჯგუფს დაავალა SQLite მონაცემთა ბაზის ხელახლა შექმნა Rust ენაზე. სისტემას არ ჰქონდა წვდომა ინტერნეტთან ან არსებულ საწყის კოდთან და მხოლოდ ოფიციალური დოკუმენტაციით სარგებლობდა. ექსპერიმენტი სრულ იზოლაციაში მიმდინარეობდა, რათა შედეგების ობიექტურობა უზრუნველყოფილიყო. ახალმა არქიტექტურამ, სადაც დამგეგმავის და შემსრულებლის როლები 2 სხვადასხვა დონეზეა გაყოფილი, ტესტების ნაკრებში 100%-იანი ქულა დააგროვა. ძველმა სისტემამ კი დავალება ვერ შეასრულა, რადგან საკუთარი კოდის მერჯ-კონფლიქტებში გაიხლართა. განახლებულმა აგენტებმა ტესტები უშეცდომოდ გაიარა და მაღალი სიზუსტე აჩვენა. პროექტის შესრულების ხარისხი უმაღლესი აღმოჩნდა. Cursor-ის წარმომადგენელმა პრესკონფერენციაზე აღნიშნა: „ძვირადღირებული მოდელები ქმნის დეტალურ გეგმას და ამოცანებს პატარა ნაწილებად ყოფს, რის შემდეგაც იაფი AI-მოდელები ინსტრუქციებს ზუსტად ასრულებს". მან დაამატა, რომ ეს პროცესი საერთო ხარჯებს მკვეთრად ამცირებს. პროცესის მენეჯმენტი სრულად ავტომატიზებულია და შეცდომების ალბათობა მინიმუმამდე დადის, რაც პროდუქტიულობას ზრდის. ტესტირებისას გამოვლინდა, რომ შემსრულებელი აგენტების ფუნქციის გადანაწილება API-ს ხარჯებს 70%-ით ამცირებს. ამასთან, კოდის ხარისხი და სიზუსტე უცვლელი რჩება, რაც დეველოპერული კომპანიებისთვის უზარმაზარ ფინანსურ შეღავათს ნიშნავს. ტექნოლოგიური გუნდები რესურსებს დაზოგავს და ეფექტიანობას გაზრდის. კომპანიები შეძლებს მეტი პროექტის განხორციელებას. ძველი აგენტური სისტემა 1 ცენტრალიზებული მოდელით მუშაობდა, რაც დიდი მოცულობის კოდის დამუშავებისას შეცდომების რაოდენობას ზრდიდა. ახალმა მიდგომამ კი გუნდური მუშაობის პრინციპი დანერგა. აგენტებს შორის იერარქიული გადანაწილება ეფექტიანობას ზრდის და კონფლიქტებს აცილებს თავიდან. ეს მიდგომა სისტემურ შეცდომებს გამორიცხავს. დეველოპერების თქმით, ეს მიდგომა პროგრამული უზრუნველყოფის შექმნის პროცესს ფუნდამენტურად ცვლის. 1 ფლაგმანურ მოდელს შეუძლია ასობით იაფი აგენტის მუშაობა გააკონტროლოს და რთული პროექტები მოკლე დროში განახორციელოს. ეს მოდელი მასშტაბირების ახალ შესაძლებლობებს ქმნის ინდუსტრიაში. პროგრამირების სექტორი ახალ ეტაპზე გადადის. ექსპერიმენტმა დაადასტურა, რომ Rust-ის მსგავს რთულ ენაზე SQLite-ის ხელახლა დაწერა სრულად ავტომატიზებადია. 100%-იანი შედეგი აჩვენებს, რომ სწორი არქიტექტურის შემთხვევაში AI-აგენტები რთულ სისტემურ პროგრამირებას უმკლავდება. ტექნიკური ამოცანების გადაჭრა საგრძნობლად მარტივდება. ეს აღმოჩენა AI-დეველოპმენტისთვის უმნიშვნელოვანეს მოვლენას წარმოადგენს. Cursor-ის გუნდი გეგმავს, აღნიშნული არქიტექტურა თავის კომერციულ პროდუქტში 2026 წლის განმატებაზე სრულად დანერგოს. ეს მომხმარებლებს საშუალებას მისცემს, რთული აპლიკაციები მინიმალური დანახარჯებით შექმნას. პლატფორმის ახალი ვერსია დეველოპერებს დიდ უპირატესობას მიანიჭებს. ბაზარზე კონკურენცია ახალ დონეზე ავა. პროგრამული უზრუნველყოფის ინჟინრები აღნიშნავს, რომ ახალი არქიტექტურა საშუალებას იძლევა, მცირე გუნდებმაც კი მასშტაბური პროექტები მართოს. იაფი მოდელების ეფექტიანი გამოყენება სტარტაპებისთვის დამატებითი სტიმული გახდება. ხარჯების შემცირება ახალ კომპანიებს ბაზარზე დამკვიდრებას გაუადვილებს. პროცესი სრულიად გამჭვირვალე ხდება. სისტემური არქიტექტორების შეფასებით, მოდელების იერარქიული დაყოფა აგენტურ ინჟინერიაში ახალ ეპოქას იწყებს. ავტომატიზაციის ეს დონე კომპანიებს საშუალებას მისცემს, 3 დღის ვადაში შექმნას მაღალი ხარისხის პროდუქტი. ტექნოლოგიური სექტორი სწრაფად ვითარდება. ტექნოლოგიური ექსპერტების შეფასებით, მოდელების როლური გადანაწილება AI-ინდუსტრიაში ახალ სტანდარტს ამკვიდრებს. ეს მიდგომა კომპანიებს საშუალებას მისცემს, ძვირადღირებული გამოთვლითი რესურსები მაქსიმალურად ეფექტიანად გამოიყენოს და პროდუქტის შექმნის ხანგრძლივობა შეამციროს. პროგრამირების ავტომატიზაცია ახალ საფეხურზე ოდესღაც შეუძლებელ ამოცანებს გადაჭრის.

#Cursor#Rust#SQLite
Cursor's agent swarm suggests cheaper models can handle most coding when frontier models plan the work
10 აგვ 20260
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
the-decoder.com

🚀 xAI-მ ახალი მოდელი Grok 4.5 წარადგინა, რომელიც კონკურენტებზე ბევრად იაფია

ილონ მასკის საავიაციო და კოსმოსური ტექნოლოგიების კომპანიის პარალელურად არსებულმა xAI-მ ახალი მოდელი Grok 4.5 გამოუშვა. ტექნოლოგიური სიახლე ძირითადად პროგრამული კოდის წერაზე, აგენტურ ამოცანებსა და ინტელექტუალურ სამუშაოებზეა ორიენტირებული. სისტემის შესაქმნელად კომპანიამ ათობით ათასი Nvidia GB300 გრაფიკული პროცესორი გამოიყენა, რაც სწავლების პროცესის მასშტაბურობაზე მიუთითებს. ეს მიდგომა კომპანიას ეხმარება დიდი მონაცემების დამუშავებაში. მოდელის მთავარი უპირატესობა მისი განსაკუთრებული ფინანსური ეფექტიანობაა. Grok 4.5-ის ფასი 1 მილიონ შემავალ ტოკენზე $2-ს, ხოლო 1 მილიონ გამავალზე $6-ს შეადგენს. შედარებისთვის, Opus 4.8 ვერსიის ფასი $5-სა და $25-ს აღწევს, ხოლო Anthropic-ის Fable 5-ის გამოყენება მომხმარებელს $10 და $50 უჯდება. OpenAI-ს GPT-5.5 მოდელის ტარიფები კი $5 შემავალ და $30 გამავალ ტოკენზე განისაზღვრება. ეს ტარიფები მნიშვნელოვან გავლენას ახდენს ბაზარზე კონკურენციაზე. დამოუკიდებელი ანალიტიკური პლატფორმის Artificial Analysis მონაცემებით, Grok 4.5-ის მიერ ერთი სტანდარტული ამოცანის შესრულება საშუალოდ $0,31 ღირს. ეს მაჩვენებელი Kimi K2.6 მოდელზე ნაკლებია და 5-ჯერ უფრო იაფია, ვიდრე Claude Sonnet 5, რომელიც ამავე ინდექსში უფრო დაბალ ქულას აჩვენებს. მსგავსი საფასო სტრატეგია ჩინური მწარმოებლების მიდგომას ჰგავს, რომლებიც ფასით კონკურენციაზე აკეთებენ აქცენტს და ცდილობენ მომხმარებლების მოზიდვას. აგენტური მუშაობის ინდექსში Grok 4.5 განსაკუთრებით მაღალ შედეგებს აჩვენებს. პროგრამული კოდის წერის ტესტში, Grok Build გარემოში მუშაობისას, მოდელმა 76 ქულა დააგროვა. ეს შედეგი სრულად უთანაბრდება GPT-5.5-ის მაჩვენებელს და მხოლოდ 1 ქულით ჩამორჩება ლიდერ Fable 5-ს, რომლის გამოყენებაც ბევრად უფრო ძვირია. ამავდროულად, xAI-ს მოდელი ამოცანის შესასრულებლად ნაკლებ რესურსს მოითხოვს, რაც მის პრაქტიკულ ეფექტიანობაზე მიუთითებს. ფინანსური თვალსაზრისით, Grok Build-ში ერთი ამოცანის გადაჭრა $2,49 ჯდება, მაშინ როდესაც GPT-5.5-ის შემთხვევაში ეს თანხა $5,07-ს შეადგენს, ხოლო Fable 5-ით მუშაობისას $11,80-ს აღწევს. ტოკენების მოხმარების მხრივაც Grok 4.5 საშუალოდ 1,9 მილიონ ტოკენს ხარჯავს ერთ ამოცანაზე, რაც მნიშვნელოვნად ნაკლებია კონკურენტების მაჩვენებლებზე, სადაც GPT-5.5 იყენებს 6,2 მილიონს, ხოლო Fable 5 კი 7,2 მილიონს. ტექნოლოგიური ტესტირების შედეგები სხვადასხვა პლატფორმაზე განსხვავებულია. Terminal Bench 2.1 რეიტინგში Grok 4.5-მა 83,3% დააფიქსირა, რაც თითქმის უტოლდება GPT-5.5-ის 83,4%-იან შედეგს. თუმცა, DeepSWE 1.1 ტესტში, რომელიც GitHub-ის რეალური პრობლემების გადაჭრას ზომავს, xAI-ს ახალმა მოდელმა 53% აჩვენა, რაც ჩამორჩება GPT-5.5-ის 67%-სა და Fable 5-ის 70%-იან მაჩვენებლებს. ეს სხვაობა აჩვენებს მოდელის სუსტ მხარეებს რთული კოდის შექმნისას. უფრო რთულ პროგრამულ გამოცდაში SWE Bench Pro, მოდელმა 64,7%-ს მიაღწია. გარკვეულ კონფიგურაციებში მან გადააჭარბა Opus 4.8 ვერსიის შედეგებს, თუმცა ვერ მიაღწია Fable 5-ის 80,4%-იან ნიშნულს. ამავდროულად, კომპანიის ცნობით, Grok 4.5 დაახლოებით 4,2-ჯერ ნაკლებ ტოკენს იყენებს აღნიშნულ ამოცანებში, ხოლო მისი მუშაობის სიჩქარე წამში 80 ტოკენს შეადგენს. ანალიტიკოსმა აღნიშნა, რომ მოდელის სუსტი მხარეებიც შესამჩნევია. AA-Omniscience ინდექსის მონაცემებით, Grok 4.5-ის სიზუსტე 35%-დან 52%-მდე გაიზარდა, თუმცა ჰალუცინაციების სიხშირემ 25%-დან 54%-მდე მოიმატა. ეს ნიშნავს, რომ მოდელი უფრო მეტ ინფორმაციას ფლობს, მაგრამ ხშირად უფრო თავდაჯერებულად ცდება, რაც მომხმარებლისთვის დამატებით საფრთხეებს ქმნის. კომპანია ცდილობს ამ პრობლემის გამოსწორებას ახალი მონაცემების ფილტრაციის მეშვეობით. პროდუქტის განვითარების პარალელურად, xAI აძლიერებს თავის პოზიციებს დეველოპერულ ბაზარზე. ივნისის შუა რიცხვებში კომპანიამ $60 მილიარდის ღირებულების აქციების სანაცვლოდ შეიძინა პოპულარული კოდის რედაქტორი Cursor. მოდელი უკვე ხელმისაწვდომია მომხმარებლებისთვის Grok Build გარემოში, სადაც გაშვებულია სპეციალური დანამატები საოფისე პროგრამებისთვის Excel, Word და PowerPoint. როგორც კომპანია აცხადებს, ახალი მოდელი ევროკავშირის ტერიტორიაზე ჯერჯერობით ხელმისაწვდომი არ არის. კომპანია ამ რეგიონში მოდელის წარდგენას ივლისის შუა რიცხვებში გეგმავს. სწავლების ეტაპზე გამოყენებული იყო განმამტკიცებელი სწავლება ასობით ათას ამოცანაზე, რამაც ხელი შეუწყო მოდელის ოპტიმიზაციას. კომპანიის განცხადებაში ნათქვამია: „ჩვენ დარწმუნებულები ვართ, რომ მეტი სწავლება და ექსპერიმენტები ამ მაჩვენებლის ზრდას კიდევ უფრო შეუწყობს ხელს“.

#xAI#Grok#Grok-4.5
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
22 ივლ 20269
Frontier AI Is Faceplanting at Real-World Workplace Tasks
futurism.com

📊 UC Berkeley-ს კვლევა: AI მოდელები რეალურ სამუშაო ამოცანებში მარცხდება

ხელოვნური ინტელექტის ინდუსტრიაში განხორციელებულმა ინვესტიციებმა 1.6 ტრილიონ დოლარს გადააჭარბა, თუმცა ახალი კვლევა აჩვენებს, რომ წამყვანი AI მოდელები რეალური სამუშაო ამოცანების შესრულებისას სერიოზულ პრობლემებს აწყდებიან. კალიფორნიის უნივერსიტეტის ბერკლის ცენტრის მკვლევრებმა მოამზადეს სპეციალური ბენჩმარკი Agents' Last Exam, რომელმაც თანამედროვე მოდელების შესაძლებლობები დეტალურად შეაფასა. კვლევის ფარგლებში შემოწმდა 55 სხვადასხვა პროფესიის 1 500-ზე მეტი რეალური ამოცანა. ტესტირება მოიცავდა როგორც პროგრამულ ინჟინერიასა და გრაფიკულ დიზაინს, ასევე საზღვაო ინჟინერიას, სოფლის მეურნეობასა და საზოგადოებრივი ჯანდაცვის ოპერაციებს. შედეგებმა აჩვენა, რომ AI აგენტები კომპლექსურ დავალებებთან გამკლავებას ჯერ კიდევ ვერ ახერხებენ. მკვლევრებმა გამოცადეს წამყვანი დახურული მოდელები, მათ შორის OpenAI-ის GPT-5.5, Anthropic-ის Fable 5, Google-ის Gemini 3.1 Pro და Cursor-ის Composer 2.5. საუკეთესო შედეგი OpenAI-ის GPT-5.5-მა აჩვენა, თუმცა მისი წარმატების მაჩვენებელი საერთო ამოცანების მხოლოდ 24%-ს შეადგენდა, რაც ინდუსტრიის მაღალ მოლოდინებზე ბევრად დაბალია. კალიფორნიის უნივერსიტეტის კომპიუტერული მეცნიერებების მკვლევარმა, დონ სონგმა, განმარტა: „დღევანდელ აგენტებს შეუძლიათ პროფესიული ამოცანების გარკვეული ნაწილის გადაჭრა. თუმცა, როდესაც საქმე ეხება ყველაზე რთულ დავალებებს, რომლებიც ხანგრძლივ მსჯელობასა და ღრმა დომენურ ექსპერტიზას მოითხოვს, ისინი ადამიანურ დონეს ჯერ კიდევ შორს არიან.“ ბენჩმარკის ყველაზე რთულ ეტაპზე ტესტირებულმა ყველა მოდელმა, მათ შორის Anthropic-ის Fable 5-მა, 0%-იანი წარმატების მაჩვენებელი აჩვენა. ამასთანავე, მკვლევრებმა აღნიშნეს ხარჯების ეფექტიანობის პრობლემაც: Fable 5 მსგავს შედეგებს აჩვენებდა, თუმცა თითოეულ შესრულებულ ამოცანაზე 4-დან 12-ჯერ მეტ დანახარჯს მოითხოვდა სხვა მოდელებთან შედარებით. კომპანიების ცნობით, მიუხედავად დაბალი შედეგებისა, ტექნოლოგიური სექტორი კვლავ აქტიურად ცდილობს AI აგენტების სამუშაო პროცესებში ინტეგრირებას. ექსპერტების შეფასებით, რუტინული და კარგად განსაზღვრული პროცედურების მქონე პროფესიები პირველ რიგში დადგებიან ცვლილებების წინაშე, ხოლო გადაწყვეტილების მიმღები პოზიციები უფრო დიდხანს შეინარჩუნებენ მდგრადობას. ანგარიშის თანახმად, კვლევაში მონაწილეობდა ორი ჩინური ღია მოდელიც, რომლებმაც ასევე ვერ შეძლეს მაღალი შედეგების დაფიქსირება. სპეციალისტები მიუთითებენ, რომ AI ინდუსტრიაში არსებული გიგანტური დანახარჯები ჯერჯერობით ვერ უზრუნველყოფს სამუშაო ადგილებზე ადამიანის სრულფასოვან ჩანაცვლებას, რადგან ტექნოლოგია ხშირად უშვებს შეცდომებს. დონ სონგმა დამატებით აღნიშნა: „მთავარი ფაქტორი არის არა თავად ინდუსტრია, არამედ სამუშაოს ხასიათი.“ მან დასძინა, რომ კომპანიებმა ყურადება უნდა გაამახვილონ AI ინსტრუმენტების სწორ გამოყენებაზე და არა მათზე სრულ დაყრდნობაზე, რადგან შეცდომების რისკი კვლავ მაღალი რჩება კრიტიკულ სფეროებში. მკვლევრების განცხადებით, კვლევის შედეგები გამოქვეყნდა 2026 წლის 21 ივლისს და მან უკვე გამოიწვია დისკუსია ტექნოლოგიურ წრეებში. ანალიტიკოსები ვარაუდობენ, რომ კომპანიებს მოუწევთ თავიანთი ინვესტიციების გადანაწილება და აქცენტის გაკეთება მოდელების სანდოობის ამაღლებაზე, რათა თავიდან აიცილონ ფინანსური დანაკარგები. ექსპერტების შეფასებით, AI აგენტების განვითარება მოითხოვს ახალი არქიტექტურული მიდგომების შემუშავებას. უახლოეს 3 წელიწადში მოსალოდნელია კვლევების გააქტიურება ჰალუცინაციების შემცირებისა და ხანგრძლივი მსჯელობის უნარების გაუმჯობესების მიმართულებით, რაც აუცილებელია სამუშაო პროცესების ავტომატიზაციისთვის. ტექნოლოგიური სექტორის წარმომადგენლები აცხადებენ, რომ ბენჩმარკების შედეგები გათვალისწინებული იქნება მომავალი მოდელების შემუშავებისას. დეველოპერები გეგმავენ 2026 წლის ბოლომდე წარმოადგინონ ახალი არქიტექტურა, რომელიც რთული ამოცანების შესრულების ხარისხს გაზრდის და შეცდომების ალბათობას შეამცირებს. მონაცემები მოწმობს, რომ მიმდინარე მოდელებს განსაკუთრებით უჭირთ კონტექსტის ხანგრძლივად შენარჩუნება და მრავალეტაპიანი დავალებების თანმიმდევრული შესრულება. ინჟინრები უკვე მუშაობენ მეხსიერების ახალ მექანიზმებზე, რომლებიც ამ ხარვეზებს აღმოფხვრის და მოდელების ეფექტიანობას გაზრდის. სპეციალისტები მიუთითებენ, რომ AI სისტემების დანერგვა მოითხოვს ადამიანის მუდმივ ზედამხედველობას. კომპანიები, რომლებიც პროცესების ავტომატიზაციას გეგმავენ, იძულებულნი არიან შეინარჩუნონ ხარისხის კონტროლის მექანიზმები შეცდომების თავიდან ასაცილებლად. ანალიტიკოსები აღნიშნავენ, რომ ხელოვნური ინტელექტის შესაძლებლობების გადაფასებამ შესაძლოა გამოიწვიოს ინვესტიციების ტემპის შენელება. კვლევის ავტორები მიუთითებენ, რომ AI ტექნოლოგიების შეფასება უნდა მოხდეს რეალური შედეგების მიხედვით. შრომის ბაზარზე AI-ის გავლენა დამოკიდებული იქნება იმაზე, თუ რამდენად სწრაფად შეძლებენ დეველოპერები არსებული ფუნდამენტური ხარვეზების აღმოფხვრას და მოდელების საიმედოობის უზრუნველყოფას.

#UC Berkeley#Agents Last Exam#GPT-5.5
Frontier AI Is Faceplanting at Real-World Workplace Tasks
22 ივლ 20269
SpaceX bets $60 billion on Cursor to catch OpenAI and Anthropic
the-decoder.com
ალან ტიურინგინიკოლა ტესლაშოთა რუსთაველი

💰 SpaceX-მა $60 მილიარდად შეიძინა Cursor-ის შემქმნელი სტარტაპი Anysphere

კომპანია SpaceX-მა დაასრულა მოლაპარაკებები და $60 მილიარდად შეიძინა ხელოვნური ინტელექტის პროგრამირების ასისტენტის, Cursor-ის შემქმნელი სტარტაპი Anysphere. ეს გადაწყვეტილება Nasdaq-ის ბირჟაზე SpaceX-ის აქციების განთავსებიდან ზუსტად ორ სამუშაო დღეში დაიხურა. ბაზარზე კომპანიის ღირებულებამ $2 ტრილიონს გადააჭარბა, ხოლო აქციების ფასი სამშაბათს კიდევ 8%-ით გაიზარდა. ილონ მასკის კომპანია აცნობიერებს, რომ ხელოვნური ინტელექტის მოდელების განვითარებაში ჩამორჩება ლიდერებს, როგორიცაა OpenAI და Anthropic. ამ ხარვეზის აღმოსაფხვრელად xAI განყოფილება, რომელიც თებერვალში SpaceX-ს შეუერთდა, აქტიურად გამოიყენებს Anysphere-ის ტექნოლოგიურ რესურსს. Bloomberg-ის ინფორმაციით, Cursor-ის ინჟინრები უკვე კვირებია xAI-ის ოფისში ახალ მოდელზე მუშაობენ. მილიარდერმა X პლატფორმაზე დაადასტურა, რომ SpaceX და Cursor ერთობლივად ატრენინგებენ ხელოვნური ინტელექტის ახალ მოდელს: „კომპანია ახალ მოდელს Cursor-ის გუნდთან ერთად ავარჯიშებს.“ მოდელი დაფუძნებული იქნება Cursor-ის ტექნოლოგიასა და SpaceX-ის გამოთვლით სიმძლავრეებზე. კომპანია იმედოვნებს, რომ ეს ნაბიჯი პროგრამული კოდის წერის ავტომატიზაციაში ლიდერობას მოუტანს. ფინანსური ანგარიშის მონაცემებით, Cursor ერთ-ერთი ყველაზე სწრაფად მზარდი სტარტაპია, რომლის წლიურმა შემოსავალმა აპრილის ბოლოსთვის $3 მილიარდს მიაღწია. თებერვალში ეს მაჩვენებელი მხოლოდ $2 მილიარდი იყო, რაც მოთხოვნის მკვეთრ ზრდაზე მიუთითებს. სტარტაპს ჰყავს 3 000-ზე მეტი კლიენტი, რომლებიც წლიურად მინიმუმ $100 000-ს იხდიან, რაც სტაბილურ ზრდას უზრუნველყოფს. SpaceX-ის წარმომადგენელმა განმარტა, რომ გარიგება Cursor-ს მისცემს წვდომას კომპანიის მიკროჩიპების უზარმაზარ მარაგზე. xAI-ის გუნდი მანამდე სერიოზულ პრობლემებს აწყდებოდა კადრების შენარჩუნების კუთხით, რადგან ათობით ინჟინერმა კომპანია დატოვა. ილონ მასკი იძულებული გახდა თანამშრომლები Starlink-იდან და Tesla-დან გადმოეყვანა, რათა 1 წელიწადში არსებული ხარვეზები შეევსო. სტრატეგიული ანალიტიკოსების შეფასებით, მასკის ხელოვნური ინტელექტის პროექტები კომპანიისთვის საკმაოდ ძვირი ჯდება. SpaceX-ის წმინდა ზარალმა 2025 წელს $4.94 მილიარდი შეადგინა მას შემდეგ, რაც xAI-ის ვალები დაფარა. კომპანიის კაპიტალური ხარჯები კი გაორმაგდა და $20.7 მილიარდს მიაღწია, საიდანაც უდიდესი ნაწილი AI მიმართულებაზე წავიდა. კონკურენცია პროგრამირების ასისტენტების ბაზარზე ყოველდღიურად მწვავდება. OpenAI-მ ცოტა ხნის წინ შეიძინა ღრუბლოვანი პლატფორმა Ona, რათა საკუთარი აგენტების ინფრასტრუქტურა გააძლიეროს. Anthropic-ი ასევე აფართოებს თავის დეპარტამენტს Claude-ის ბაზაზე პროგრამული კოდის წერის გასაუმჯობესებლად, რაც ბაზარზე კონკურენციას კიდევ უფრო ზრდის. გარიგების დასრულება 2026 წლის მესამე კვარტალში იგეგმება, რის შემდეგაც Anysphere-ის აქციონერები SpaceX-ის ფასიან ქაღალდებს მიიღებენ. Anysphere ასევე ფლობს საკადრო სააგენტოს, რომელიც წამყვან ტექნოლოგიურ კომპანიებს საუკეთესო ინჟინრების პოვნაში ეხმარება. ეს რესურსი xAI-ს დაეხმარა წამყვანი სპეციალისტების მოზიდვაში. ფინანსური ანალიტიკოსები მიიჩნევენ, რომ Anysphere-ის შეძენა SpaceX-ს დაეხმარება ტექნოლოგიურ რბოლაში ლიდერობის მოპოვებაში. კოდის წერის ავტომატიზაცია არის ერთ-ერთი ყველაზე მომგებიანი სეგმენტი ხელოვნური ინტელექტის ბაზარზე. მასკის კომპანია ცდილობს მაქსიმალურად გამოიყენოს ეს შანსი და გაასწროს კონკურენტებს, რისთვისაც ფინანსურ რესურსებს არ ზოგავს. მოხმარების ხარჯები და ტოკენების ფასები მუდმივად იცვლება, რაც კომპანიებს აიძულებს უფრო მეტად დაეყრდნონ საკუთარ შიდა ინფრასტრუქტურას. SpaceX-ის მასშტაბები კი ამის საშუალებას იძლევა. ტექნოლოგიური გიგანტები ცდილობენ მაქსიმალურად შეამცირონ დამოკიდებულება მესამე მხარის მოდელებზე, რათა თავიდან აიცილონ ფასების მოულოდნელი ზრდა. კომპანიის წარმომადგენლები წერენ, რომ ახალი პარტნიორობა ორგანიზაციისთვის ისტორიულ შესაძლებლობას წარმოადგენს. SpaceX-ის გამოთვლითი სიმძლავრეები და Cursor-ის ტექნოლოგიური ბაზა ქმნის სრულყოფილ პლატფორმას განვითარებისთვის. ეს გარიგება განსაზღვრავს ტექნოლოგიური რბოლის მომავალს უახლოესი წლების განმავლობაში. Anysphere-ის ინტეგრაცია SpaceX-ში ხელს შეუწყობს სრულიად დამოუკიდებელი ეკოსისტემის შექმნას, რაც მათ უპირატესობას მისცემს. ეს ნაბიჯი ასევე გააძლიერებს xAI-ის პოზიციებს, რაც ინვესტორებისთვის დამატებითი გარანტია იქნება. ხელოვნური ინტელექტის ბაზარზე მიმდინარე პროცესები აჩვენებს, რომ კოდის ავტომატიზაცია გლობალური ინდუსტრიის მომავალია.

#openai#ai#anthropic
SpaceX bets $60 billion on Cursor to catch OpenAI and Anthropic
17 ივნ 202610
New review paper argues code is how AI agents think and act, not just what they produce
the-decoder.com
მარი კიურირიჩარდ ფაინმანიშოთა რუსთაველისტივ ჯობსი+1

🧪 ახალი ნაშრომის მიხედვით კოდი ხელოვნური ინტელექტის აგენტების აზროვნების გარემოა

ხელოვნური ინტელექტის ავტონომიური აგენტების განვითარებაში სრულიად ახალი ეტაპი დაიწყო, სადაც კოდი აღარ განიხილება როგორც უბრალო საბოლოო პროდუქტი. ილინოისის უნივერსიტეტის, Meta-სა და სტენფორდის მკვლევრების ერთობლივ ნაშრომში ნათქვამია, რომ პროგრამული კოდი წარმოადგენს ძირითად გარემოს, რომლის მეშვეობითაც აგენტები აზროვნებენ, გეგმავენ მოქმედებებს და ერთმანეთთან თანამშრომლობენ. გამოცემა THE DECODER-ის ცნობით, სამეცნიერო ნაშრომის ავტორები განსაკუთრებულ ყურადღებას ამახვილებენ სპეციალურ პროგრამულ გარემოზე, რომელსაც მათ აღკაზმულობა შეარქვეს. აღნიშნული პროგრამული ფენა აერთიანებს ხელსაწყოებს, ინტერფეისებს, უსაფრთხოების საზღვრებს, მეხსიერებასა და გამოხმაურების არხებს. ეს მიდგომა ხელოვნური ინტელექტის მკვლევარ გარი მარკუსსაც კმაყოფილს ხდის, რადგან ის პროგრამული ჩარჩოების საჭიროებას ამტკიცებდა. ავტონომიური სისტემებისთვის კოდის გამოყენება მნიშვნელოვანია მისი უნიკალური თვისებების გამო. პროგრამული ენა არის შესრულებადი, რაც იძლევა გამოთვლების რეალურად შემოწმების საშუალებას. გარდა ამისა, შუალედური ოპერაციები ინახება სტრუქტურული კვალის სახით, ხოლო პროგრამის ლოგები სისტემას საშუალებას აძლევს, მუშაობა შეჩერების ადგილიდან ყოველგვარი შეფერხების გარეშე გააგრძელოს. მეცნიერები ავტონომიურ აგენტებს 3 ძირითად ნაწილად ყოფენ, რომლებიც მათ ფუნქციონირებას უზრუნველყოფს. ესენია თავად მოდელის შინაგანი შესაძლებლობები, ორგანიზაციის მიერ მოწოდებული ინფრასტრუქტურა და მუშაობის პროცესში აგენტის მიერ შექმნილი კოდი. ეს უკანასკნელი მოიცავს დამხმარე სკრიპტებსა და ტესტებს, რომლებსაც აქამდე მკვლევრების მხრიდან სათანადო ყურადღება არ ექცეოდა. პირველ დონეზე კოდი ასრულებს ხიდის როლს მოდელსა და მის გარემოს შორის, რაც საშუალებას იძლევა ბუნებრივი ენით დაწერილი მოთხოვნები რობოტის მართვის კოდად გარდაიქმნას. მეორე დონეზე ხორციელდება დაგეგმვისა და შემოწმების ციკლი, სადაც ნებისმიერი მოქმედება უსაფრთხო, იზოლირებულ გარემოში მოწმდება. ეს მეთოდი გამორიცხავს ერთჯერად შეცდომებს და უზრუნველყოფს სისტემურ მდგრადობას. მესამე დონეზე ხდება აგენტების ჯგუფური თანამშრომლობა, სადაც სპეციალიზებული როლები, როგორიცაა მენეჯერები, კოდერები და ტესტერები, საერთო სამუშაო სივრცეში ნაწილდება. მსგავსი პრაქტიკა უკვე დანერგილია ისეთ სისტემებში, როგორიცაა ChatDev და MetaGPT. კორპორატიულ პროდუქტებში Claude Code-ს შეუძლია კოდის შემოწმების დავალებები აგენტთა მთელ გუნდს გადაუნაწილოს, რომლებიც პარალელურად მუშაობენ. ამ ტექნოლოგიური გარემოს მნიშვნელობა აშკარა გახდა მას შემდეგ, რაც ინტერნეტში შემთხვევით გაჟონა Claude Code-ის 500 000 ხაზი კოდი. დოკუმენტებში აღმოჩნდა სპეციალური ფუნქცია, რომელიც აგენტების მუშაობას წარმართავდა. კომპანია Anthropic-მა საავტორო უფლებების დაცვის მოთხოვნით GitHub პლატფორმიდან აღნიშნული კოდის 8 000-ზე მეტი ასლი წაშალა, რითაც სცადა ინფორმაციის გავრცელების შეჩერება. სხვა ლაბორატორიებიც აქტიურად ცდილობენ ამ მიმართულებით განვითარებას. ჩინური Deepseek გეგმავს კონკურენცია გაუწიოს ამერიკულ მოდელებს და პეკინში სპეციალური Harness-ის გუნდი შექმნა. ჩინელი სპეციალისტების ფორმულის თანახმად, ხელოვნური ინტელექტის აგენტის შესაქმნელად აუცილებელია მოდელისა და შესაბამისი პროგრამული აღკაზმულობის ერთობლივი მუშაობა, რაც წარმატების გარანტიაა. მომავალი თაობის მოდელების სწავლებისთვის უკვე აქტიურად გამოიყენება აგენტების საოპერაციო მონაცემები. Cursor-ის სისტემა რეალური მომხმარებლების ქცევის ანალიზით სწავლობს, ხოლო OpenAI-ის Codex-1, GPT-5-Codex და GPT-5.1-Codex-Max მოდელები სპეციალურად გაიწვრთნენ გრძელვადიან, მრავალეტაპიან პროგრამულ სესიებზე. გარდა ამისა, შემუშავდა AutoHarness სისტემა, რომელიც ავტომატურად ზღუდავს დაუშვებელ ქმედებებს. ნაშრომის ავტორები საკმაოდ კრიტიკულად აფასებენ საგამოცდო კრიტერიუმების სანდოობას. მწვანე ნიშანი არ ნიშნავს, რომ პროგრამა უსაფრთხოა, რადგან ტესტებმა შესაძლოა მნიშვნელოვანი შეცდომები გამოტოვონ. ექსპერტები მიიჩნევენ, რომ ყოველ ქმედებას თან უნდა ახლდეს დოკუმენტაცია, სადაც დეტალურად იქნება აღწერილი ჩატარებული ტესტები, დაფარვის ზონები და გამოვლენილი პოტენციური რისკები. გამოცემის ანალიტიკოსმა ჯონათან კემპერმა მიუთითა, რომ საიმედოობა დამოკიდებულია არა უკეთეს მოთხოვნებზე, არამედ მოდელის გარშემო არსებული კონტროლირებადი გარემოს მუშაობაზე. მკვლევრები იმედოვნებენ, რომ ახალი მიდგომა ხელს შეუწყობს ავტონომიური სისტემების განვითარებას და მათ უსაფრთხო ინტეგრაციას ყოველდღიურ საოპერაციო პროცესებში, რაც მნიშვნელოვნად შეამცირებს შეცდომების ალბათობას.

#openai#ai#gpt
New review paper argues code is how AI agents think and act, not just what they produce
8 ივნ 202616
Deepseek wants to take on Claude Code and OpenAI's Codex with "Deepseek Code"
the-decoder.com

🛠 DeepSeek-მა კოდირების აგენტისთვის 2 ახალი ვაკანსია გამოაცხადა

ჩინური ხელოვნური ინტელექტის კომპანიის, DeepSeek-ის მკვლევარმა და წარმომადგენელმა, დელი ჩენმა, ოთხშაბათს სოციალურ ქსელ X-ზე ახალი კოდირების აგენტის, DeepSeek Code-ის შექმნა და პეკინში 1 ახალი სამუშაო გუნდის ჩამოყალიბება ოფიციალურად დააანონსა. ახლადშექმნილი Harness გუნდის მთავარი დანიშნულება ნულიდან ისეთი ინფრასტრუქტურის აშენებაა, რომელიც ძირითად მოდელს ინსტრუმენტების, დაგეგმვისა და მეხსიერების ფუნქციებს დაუმატებს. ჩენმა უკვე გამოაქვეყნა 2 ახალი პოზიცია - პროდუქტის მენეჯერისა და დეველოპერის ვაკანსიები, რომლებიც კვლევით გუნდთან ითანამშრომლებენ პროექტის განვითარების გეგმაზე, უკუკავშირის ანალიზსა და დეველოპერთა საზოგადოების მშენებლობაზე. შერჩეულ კანდიდატებს მოეთხოვებათ ბაზარზე უკვე არსებული ინსტრუმენტების, მათ შორის Claude Code-ის, Cursor-ის, Codex-ისა თუ GitHub Copilot-ის ინტენსიური გამოყენების გამოცდილება. გარდა ამისა, სავალდებულოა ისეთი ტექნიკური მიმართულებების სიღრმისეული ცოდნა, როგორიცაა აგენტების ციკლები, Model Context Protocol-ი (MCP), მულტი-აგენტური სისტემები, კონტექსტის ინჟინერია და „vibe coding“-ი. მსგავსი პროდუქტის შექმნით DeepSeek-ი პირდაპირ კონკურენციაში შედის ბაზრის ამჟამინდელ წამყვან ინსტრუმენტებთან, მათ შორის Anthropic-ის Claude Code-თან, OpenAI-ის Codex-სა და Cursor-თან. ახალი აგენტის შემუშავება მიზნად ისახავს დეველოპერებისთვის განკუთვნილი ავტომატიზაციის ინსტრუმენტების ბაზარზე კონკურენციის გაზრდას და მომხმარებლებისთვის ალტერნატიული სამუშაო პლატფორმის შეთავაზებას.

#openai#ai#anthropic
Deepseek wants to take on Claude Code and OpenAI's Codex with "Deepseek Code"
21 მაი 202624

All insights loaded