
🚀 xAI-მ ახალი მოდელი Grok 4.5 წარადგინა, რომელიც კონკურენტებზე ბევრად იაფია
ილონ მასკის საავიაციო და კოსმოსური ტექნოლოგიების კომპანიის პარალელურად არსებულმა xAI-მ ახალი მოდელი Grok 4.5 გამოუშვა. ტექნოლოგიური სიახლე ძირითადად პროგრამული კოდის წერაზე, აგენტურ ამოცანებსა და ინტელექტუალურ სამუშაოებზეა ორიენტირებული. სისტემის შესაქმნელად კომპანიამ ათობით ათასი Nvidia GB300 გრაფიკული პროცესორი გამოიყენა, რაც სწავლების პროცესის მასშტაბურობაზე მიუთითებს. ეს მიდგომა კომპანიას ეხმარება დიდი მონაცემების დამუშავებაში. მოდელის მთავარი უპირატესობა მისი განსაკუთრებული ფინანსური ეფექტიანობაა. Grok 4.5-ის ფასი 1 მილიონ შემავალ ტოკენზე $2-ს, ხოლო 1 მილიონ გამავალზე $6-ს შეადგენს. შედარებისთვის, Opus 4.8 ვერსიის ფასი $5-სა და $25-ს აღწევს, ხოლო Anthropic-ის Fable 5-ის გამოყენება მომხმარებელს $10 და $50 უჯდება. OpenAI-ს GPT-5.5 მოდელის ტარიფები კი $5 შემავალ და $30 გამავალ ტოკენზე განისაზღვრება. ეს ტარიფები მნიშვნელოვან გავლენას ახდენს ბაზარზე კონკურენციაზე. დამოუკიდებელი ანალიტიკური პლატფორმის Artificial Analysis მონაცემებით, Grok 4.5-ის მიერ ერთი სტანდარტული ამოცანის შესრულება საშუალოდ $0,31 ღირს. ეს მაჩვენებელი Kimi K2.6 მოდელზე ნაკლებია და 5-ჯერ უფრო იაფია, ვიდრე Claude Sonnet 5, რომელიც ამავე ინდექსში უფრო დაბალ ქულას აჩვენებს. მსგავსი საფასო სტრატეგია ჩინური მწარმოებლების მიდგომას ჰგავს, რომლებიც ფასით კონკურენციაზე აკეთებენ აქცენტს და ცდილობენ მომხმარებლების მოზიდვას. აგენტური მუშაობის ინდექსში Grok 4.5 განსაკუთრებით მაღალ შედეგებს აჩვენებს. პროგრამული კოდის წერის ტესტში, Grok Build გარემოში მუშაობისას, მოდელმა 76 ქულა დააგროვა. ეს შედეგი სრულად უთანაბრდება GPT-5.5-ის მაჩვენებელს და მხოლოდ 1 ქულით ჩამორჩება ლიდერ Fable 5-ს, რომლის გამოყენებაც ბევრად უფრო ძვირია. ამავდროულად, xAI-ს მოდელი ამოცანის შესასრულებლად ნაკლებ რესურსს მოითხოვს, რაც მის პრაქტიკულ ეფექტიანობაზე მიუთითებს. ფინანსური თვალსაზრისით, Grok Build-ში ერთი ამოცანის გადაჭრა $2,49 ჯდება, მაშინ როდესაც GPT-5.5-ის შემთხვევაში ეს თანხა $5,07-ს შეადგენს, ხოლო Fable 5-ით მუშაობისას $11,80-ს აღწევს. ტოკენების მოხმარების მხრივაც Grok 4.5 საშუალოდ 1,9 მილიონ ტოკენს ხარჯავს ერთ ამოცანაზე, რაც მნიშვნელოვნად ნაკლებია კონკურენტების მაჩვენებლებზე, სადაც GPT-5.5 იყენებს 6,2 მილიონს, ხოლო Fable 5 კი 7,2 მილიონს. ტექნოლოგიური ტესტირების შედეგები სხვადასხვა პლატფორმაზე განსხვავებულია. Terminal Bench 2.1 რეიტინგში Grok 4.5-მა 83,3% დააფიქსირა, რაც თითქმის უტოლდება GPT-5.5-ის 83,4%-იან შედეგს. თუმცა, DeepSWE 1.1 ტესტში, რომელიც GitHub-ის რეალური პრობლემების გადაჭრას ზომავს, xAI-ს ახალმა მოდელმა 53% აჩვენა, რაც ჩამორჩება GPT-5.5-ის 67%-სა და Fable 5-ის 70%-იან მაჩვენებლებს. ეს სხვაობა აჩვენებს მოდელის სუსტ მხარეებს რთული კოდის შექმნისას. უფრო რთულ პროგრამულ გამოცდაში SWE Bench Pro, მოდელმა 64,7%-ს მიაღწია. გარკვეულ კონფიგურაციებში მან გადააჭარბა Opus 4.8 ვერსიის შედეგებს, თუმცა ვერ მიაღწია Fable 5-ის 80,4%-იან ნიშნულს. ამავდროულად, კომპანიის ცნობით, Grok 4.5 დაახლოებით 4,2-ჯერ ნაკლებ ტოკენს იყენებს აღნიშნულ ამოცანებში, ხოლო მისი მუშაობის სიჩქარე წამში 80 ტოკენს შეადგენს. ანალიტიკოსმა აღნიშნა, რომ მოდელის სუსტი მხარეებიც შესამჩნევია. AA-Omniscience ინდექსის მონაცემებით, Grok 4.5-ის სიზუსტე 35%-დან 52%-მდე გაიზარდა, თუმცა ჰალუცინაციების სიხშირემ 25%-დან 54%-მდე მოიმატა. ეს ნიშნავს, რომ მოდელი უფრო მეტ ინფორმაციას ფლობს, მაგრამ ხშირად უფრო თავდაჯერებულად ცდება, რაც მომხმარებლისთვის დამატებით საფრთხეებს ქმნის. კომპანია ცდილობს ამ პრობლემის გამოსწორებას ახალი მონაცემების ფილტრაციის მეშვეობით. პროდუქტის განვითარების პარალელურად, xAI აძლიერებს თავის პოზიციებს დეველოპერულ ბაზარზე. ივნისის შუა რიცხვებში კომპანიამ $60 მილიარდის ღირებულების აქციების სანაცვლოდ შეიძინა პოპულარული კოდის რედაქტორი Cursor. მოდელი უკვე ხელმისაწვდომია მომხმარებლებისთვის Grok Build გარემოში, სადაც გაშვებულია სპეციალური დანამატები საოფისე პროგრამებისთვის Excel, Word და PowerPoint. როგორც კომპანია აცხადებს, ახალი მოდელი ევროკავშირის ტერიტორიაზე ჯერჯერობით ხელმისაწვდომი არ არის. კომპანია ამ რეგიონში მოდელის წარდგენას ივლისის შუა რიცხვებში გეგმავს. სწავლების ეტაპზე გამოყენებული იყო განმამტკიცებელი სწავლება ასობით ათას ამოცანაზე, რამაც ხელი შეუწყო მოდელის ოპტიმიზაციას. კომპანიის განცხადებაში ნათქვამია: „ჩვენ დარწმუნებულები ვართ, რომ მეტი სწავლება და ექსპერიმენტები ამ მაჩვენებლის ზრდას კიდევ უფრო შეუწყობს ხელს“.
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much