Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
the-decoder.com

🚀 xAI-მ ახალი მოდელი Grok 4.5 წარადგინა, რომელიც კონკურენტებზე ბევრად იაფია

ილონ მასკის საავიაციო და კოსმოსური ტექნოლოგიების კომპანიის პარალელურად არსებულმა xAI-მ ახალი მოდელი Grok 4.5 გამოუშვა. ტექნოლოგიური სიახლე ძირითადად პროგრამული კოდის წერაზე, აგენტურ ამოცანებსა და ინტელექტუალურ სამუშაოებზეა ორიენტირებული. სისტემის შესაქმნელად კომპანიამ ათობით ათასი Nvidia GB300 გრაფიკული პროცესორი გამოიყენა, რაც სწავლების პროცესის მასშტაბურობაზე მიუთითებს. ეს მიდგომა კომპანიას ეხმარება დიდი მონაცემების დამუშავებაში. მოდელის მთავარი უპირატესობა მისი განსაკუთრებული ფინანსური ეფექტიანობაა. Grok 4.5-ის ფასი 1 მილიონ შემავალ ტოკენზე $2-ს, ხოლო 1 მილიონ გამავალზე $6-ს შეადგენს. შედარებისთვის, Opus 4.8 ვერსიის ფასი $5-სა და $25-ს აღწევს, ხოლო Anthropic-ის Fable 5-ის გამოყენება მომხმარებელს $10 და $50 უჯდება. OpenAI-ს GPT-5.5 მოდელის ტარიფები კი $5 შემავალ და $30 გამავალ ტოკენზე განისაზღვრება. ეს ტარიფები მნიშვნელოვან გავლენას ახდენს ბაზარზე კონკურენციაზე. დამოუკიდებელი ანალიტიკური პლატფორმის Artificial Analysis მონაცემებით, Grok 4.5-ის მიერ ერთი სტანდარტული ამოცანის შესრულება საშუალოდ $0,31 ღირს. ეს მაჩვენებელი Kimi K2.6 მოდელზე ნაკლებია და 5-ჯერ უფრო იაფია, ვიდრე Claude Sonnet 5, რომელიც ამავე ინდექსში უფრო დაბალ ქულას აჩვენებს. მსგავსი საფასო სტრატეგია ჩინური მწარმოებლების მიდგომას ჰგავს, რომლებიც ფასით კონკურენციაზე აკეთებენ აქცენტს და ცდილობენ მომხმარებლების მოზიდვას. აგენტური მუშაობის ინდექსში Grok 4.5 განსაკუთრებით მაღალ შედეგებს აჩვენებს. პროგრამული კოდის წერის ტესტში, Grok Build გარემოში მუშაობისას, მოდელმა 76 ქულა დააგროვა. ეს შედეგი სრულად უთანაბრდება GPT-5.5-ის მაჩვენებელს და მხოლოდ 1 ქულით ჩამორჩება ლიდერ Fable 5-ს, რომლის გამოყენებაც ბევრად უფრო ძვირია. ამავდროულად, xAI-ს მოდელი ამოცანის შესასრულებლად ნაკლებ რესურსს მოითხოვს, რაც მის პრაქტიკულ ეფექტიანობაზე მიუთითებს. ფინანსური თვალსაზრისით, Grok Build-ში ერთი ამოცანის გადაჭრა $2,49 ჯდება, მაშინ როდესაც GPT-5.5-ის შემთხვევაში ეს თანხა $5,07-ს შეადგენს, ხოლო Fable 5-ით მუშაობისას $11,80-ს აღწევს. ტოკენების მოხმარების მხრივაც Grok 4.5 საშუალოდ 1,9 მილიონ ტოკენს ხარჯავს ერთ ამოცანაზე, რაც მნიშვნელოვნად ნაკლებია კონკურენტების მაჩვენებლებზე, სადაც GPT-5.5 იყენებს 6,2 მილიონს, ხოლო Fable 5 კი 7,2 მილიონს. ტექნოლოგიური ტესტირების შედეგები სხვადასხვა პლატფორმაზე განსხვავებულია. Terminal Bench 2.1 რეიტინგში Grok 4.5-მა 83,3% დააფიქსირა, რაც თითქმის უტოლდება GPT-5.5-ის 83,4%-იან შედეგს. თუმცა, DeepSWE 1.1 ტესტში, რომელიც GitHub-ის რეალური პრობლემების გადაჭრას ზომავს, xAI-ს ახალმა მოდელმა 53% აჩვენა, რაც ჩამორჩება GPT-5.5-ის 67%-სა და Fable 5-ის 70%-იან მაჩვენებლებს. ეს სხვაობა აჩვენებს მოდელის სუსტ მხარეებს რთული კოდის შექმნისას. უფრო რთულ პროგრამულ გამოცდაში SWE Bench Pro, მოდელმა 64,7%-ს მიაღწია. გარკვეულ კონფიგურაციებში მან გადააჭარბა Opus 4.8 ვერსიის შედეგებს, თუმცა ვერ მიაღწია Fable 5-ის 80,4%-იან ნიშნულს. ამავდროულად, კომპანიის ცნობით, Grok 4.5 დაახლოებით 4,2-ჯერ ნაკლებ ტოკენს იყენებს აღნიშნულ ამოცანებში, ხოლო მისი მუშაობის სიჩქარე წამში 80 ტოკენს შეადგენს. ანალიტიკოსმა აღნიშნა, რომ მოდელის სუსტი მხარეებიც შესამჩნევია. AA-Omniscience ინდექსის მონაცემებით, Grok 4.5-ის სიზუსტე 35%-დან 52%-მდე გაიზარდა, თუმცა ჰალუცინაციების სიხშირემ 25%-დან 54%-მდე მოიმატა. ეს ნიშნავს, რომ მოდელი უფრო მეტ ინფორმაციას ფლობს, მაგრამ ხშირად უფრო თავდაჯერებულად ცდება, რაც მომხმარებლისთვის დამატებით საფრთხეებს ქმნის. კომპანია ცდილობს ამ პრობლემის გამოსწორებას ახალი მონაცემების ფილტრაციის მეშვეობით. პროდუქტის განვითარების პარალელურად, xAI აძლიერებს თავის პოზიციებს დეველოპერულ ბაზარზე. ივნისის შუა რიცხვებში კომპანიამ $60 მილიარდის ღირებულების აქციების სანაცვლოდ შეიძინა პოპულარული კოდის რედაქტორი Cursor. მოდელი უკვე ხელმისაწვდომია მომხმარებლებისთვის Grok Build გარემოში, სადაც გაშვებულია სპეციალური დანამატები საოფისე პროგრამებისთვის Excel, Word და PowerPoint. როგორც კომპანია აცხადებს, ახალი მოდელი ევროკავშირის ტერიტორიაზე ჯერჯერობით ხელმისაწვდომი არ არის. კომპანია ამ რეგიონში მოდელის წარდგენას ივლისის შუა რიცხვებში გეგმავს. სწავლების ეტაპზე გამოყენებული იყო განმამტკიცებელი სწავლება ასობით ათას ამოცანაზე, რამაც ხელი შეუწყო მოდელის ოპტიმიზაციას. კომპანიის განცხადებაში ნათქვამია: „ჩვენ დარწმუნებულები ვართ, რომ მეტი სწავლება და ექსპერიმენტები ამ მაჩვენებლის ზრდას კიდევ უფრო შეუწყობს ხელს“.

Grok 4.5 is so cheap compared to Fable 5 and GPT 5.5 that benchmark gaps may not matter much
22 ივლ 20269
Open-source tool pxpipe hides text in PNGs to cut Claude Code and Fable 5 token costs up to 70%
the-decoder.com

🛠️ ღია კოდის ინსტრუმენტი pxpipe ტექსტს PNG-ში მალავს და ტოკენის ხარჯს 70%-მდე ამცირებს

ღია კოდის ინსტრუმენტმა pxpipe-მა Claude Code-ისთვის განკუთვნილი გრძელი ტექსტური მოთხოვნები კომპაქტურ PNG სურათებად აქცია და ტოკენების ხარჯი 70%-მდე შეამცირა. ხრიკი მუშაობს იმის გამო, თუ როგორ აფასებს Anthropic სურათებს თავის სატარიფო მოდელში, ვინაიდან სურათი ტექსტზე იაფად ჯდება. გამოცემა the-decoder-ის ინფორმაციით, ეს პროექტი დეველოპერმა სტივენ ჩონგმა შექმნა. მისივე ცნობით, ჯამური დანაზოგი საშუალოდ 59-დან 70 პროცენტამდე მერყეობს, დამოკიდებულებით იმაზე, თუ რამდენად მოცულობითია სტატიკური კონტექსტი. ინსტრუმენტი უკვე საჯაროდ ხელმისაწვდომია და დეველოპერების ინტერესს იწვევს. ტექსტი დაახლოებით 1 ტოკენს ჯდება თითო სიმბოლოზე, სურათი კი ფიქსირებულ ტოკენებს ითხოვს პიქსელების ზომის მიხედვით, მიუხედავად იმისა, რამდენ ტექსტს შეიცავს. თუ მკვრივ შიგთავსს, მაგალითად კოდს ან JSON-ს, სურათად დაარენდერებ, ერთ ტოკენში დაახლოებით 3.1 სიმბოლო თავსდება. pxpipe ამ იდეას ლოკალური პროქსის სახით ახორციელებს. ის ჩაჭრის Claude Code-ისკენ მიმავალ მოთხოვნებს და მოცულობით, სტატიკურ ნაწილს სურათებად რენდერავს. ამ ნაწილში შედის სისტემური მოთხოვნები, ინსტრუმენტების დოკუმენტაცია და ჩატის ძველი ისტორია. სურათი, რომელსაც მოდელი რეალურად ხედავს, მკვრივად ჩალაგებულ ტექსტს შეიცავს. უახლესი შეტყობინებები და მოდელის პასუხები ჩვეულებრივ ტექსტად გადის. ასეთი გაყოფა საშუალებას აძლევს სისტემას, დინამიკური ნაწილი წაკითხვადი დატოვოს, ხოლო უცვლელი, გამეორებადი ბლოკები კი შეკუმშოს. სწორედ ეს განმეორებადი ბლოკები, სისტემური მოთხოვნა და ინსტრუმენტების აღწერა, ყოველი მოთხოვნისას თავიდან იგზავნება და ხარჯის დიდ ნაწილს ქმნის. ჩონგის განმარტებით, დაახლოებით 48 000 სიმბოლოს მოცულობის სისტემური მოთხოვნა და დოკუმენტაცია ერთ მკვრივ PNG გვერდზე თავსდება. ტექსტად ეს დაახლოებით 25 000 ტოკენი ღირდა, სურათად კი მხოლოდ 2 700 ტოკენი, რაც თითქმის ცხრაჯერ ნაკლებია. დანაზოგის ლოგიკა მარტივია. რაც უფრო დიდი და უცვლელია კონტექსტი, მით მეტია სარგებელი, ვინაიდან სურათის ტოკენების რაოდენობა ფიქსირებული რჩება, ტექსტისა კი სიმბოლოების პროპორციულად იზრდება. ამიტომ ხრიკი განსაკუთრებით ეფექტიანია გრძელი აგენტური სესიების დროს. ერთ-ერთ Fable 5-ის დემონსტრაციაზე სესიის ღირებულება 42.21 დოლარიდან 6.06 დოლარამდე დაეცა. სწორედ ეს კონტრასტი აჩვენებს, თუ რატომ იზიდავს მიდგომა დეველოპერების ყურადღებას, რომლებიც დიდ კოდურ ბაზებთან მუშაობენ. ჩონგის თქმით, „ჯამური დანაზოგი საშუალოდ 59-დან 70 პროცენტამდეა". მისივე შეფასებით, თუ ეს ხრიკი ფართოდ გავრცელდა, AI კომპანიები საპასუხოდ სურათების დამუშავების ფასს აწევენ და უპირატესობა შესაძლოა ნაწილობრივ გაქრეს. მიდგომას ნაკლიც აქვს. ის დანაკარგებით მუშაობს და ზუსტი სტრიქონები, მაგალითად ჰეშები, სურათიდან წაკითხვისას შესაძლოა დამახინჯებული დაბრუნდეს. დამუშავებაც უფრო ნელია, რადგან მოდელი დარენდერებულ სურათებს ვიზუალურ კოდერში ატარებს, ტექსტის პირდაპირ კითხვის ნაცვლად. ამიტომ ინსტრუმენტი ვარგისია მაშინ, როცა კონტექსტი დიდია, სიზუსტის მოთხოვნა კი ზომიერი. ნაგულისხმევად pxpipe Claude Fable 5-ს და GPT 5.6-ს უჭერს მხარს. ბენჩმარკები და შეფასებები რეპოზიტორიაშია აღწერილი. Fable 5 100 პროცენტიან სიზუსტეს აღწევს მათემატიკურ ამოცანებში ახალი შემთხვევითი რიცხვებით, რომლებსაც მოდელი ვერ დაიმახსოვრებდა, რაც აჩვენებს, რომ სურათებში ჩალაგებულ ინფორმაციას ის სწორად კითხულობს. ჩონგის მონაცემებით, Opus 4.7 და 4.8 დარენდერებული სურათების დაახლოებით 7 პროცენტს არასწორად კითხულობს, ხოლო GPT 5.5-იც უარესად მუშაობს სურათული კონტექსტისას. სწორედ ამიტომ ორივე მოდელი ნაგულისხმევად გამორთულია და მხოლოდ ხელით ჩაირთვება, რაც დანაკარგის რისკს ამცირებს. ტექსტის შეკუმშულ სურათებად მიწოდება ახალი იდეა არ არის. DeepSeek-მა ააგო OCR სისტემა, რომელიც ტექსტურ დოკუმენტებს სურათებად ამუშავებს და, ტექნიკური ნაშრომის თანახმად, მათ ათჯერ შეკუმშავს, ინფორმაციის 97 პროცენტის შენარჩუნებით. pxpipe სწორედ ამ ხაზს აგრძელებს, ოღონდ პრაქტიკულ, დღიურ სამუშაო პროცესს უსადაგებს. პროექტის ავტორი აფრთხილებს, რომ ეს ბალანსია სიზუსტესა და ხარჯს შორის. ზუსტი მონაცემებისთვის ტექსტური რეჟიმი რჩება უსაფრთხო არჩევანად, დიდი, სტატიკური კონტექსტისთვის კი სურათული შეკუმშვა ხარჯს მკვეთრად ამცირებს და მუშაობის ეკონომიკას ცვლის. თუ სატარიფო მოდელი ამ ხრიკს გაითვალისწინებს, კომპანიები სავარაუდოდ სურათების ფასს დააკორექტირებენ, რაც ინსტრუმენტის მომავალს განსაზღვრავს.

Open-source tool pxpipe hides text in PNGs to cut Claude Code and Fable 5 token costs up to 70%
22 ივლ 202610
Anthropic developer shares prompting tips for Fable 5 that focus on finding your own blind spots first
the-decoder.com

🛠️ Anthropic-ის დეველოპერი Fable 5-ის პრომპტინგის რჩევებს იძლევა, აქცენტით საკუთარ ბრმა ლაქებზე

Anthropic-ის დეველოპერმა თარიქ შიჰიპარმა განაცხადა, რომ Claude-ის უახლესი მოდელით, Fable 5-ით, კოდირებისას შედეგის ხარვეზი სულ უფრო ნაკლებად თავად მოდელზეა დამოკიდებული და უფრო მეტად მომხმარებლის ბრმა ლაქებზე. გამოცემა the-decoder-ის ინფორმაციით, ეს მასალა 2026 წელს გამოქვეყნდა. შიჰიპარი აცხადებს, რომ Fable 5 პირველი მოდელია, სადაც შედეგის ხარისხს ზღუდავს მომხმარებლის უნარი, დააზუსტოს საკუთარი უცნობი საკითხები. სწორედ ეს გადააქცევს პრომპტინგს მთავარ უნარად, რომელიც შედეგზე პირდაპირ აისახება. შიჰიპარი ცოდნას 4 კატეგორიად ყოფს, 2 ღერძის, ცნობილისა და უცნობის, გადაკვეთაზე. „ცნობილი ცნობილი" ის არის, რაც უკვე პრომპტშია. „ცნობილი უცნობი" ის კითხვებია, რომლებზეც პასუხი ჯერ არ იცი, მაგრამ იცი, რომ არ იცი. „უცნობი ცნობილი" ისეთი ცოდნაა, რომელიც ისე ცხადია, რომ არასდროს ჩაწერდი, თუმცა ცნობისას ამოიცნობდი. მისივე თქმით, ყველაზე კრიტიკული კატეგორია „უცნობი უცნობია", ანუ ის, რაზეც საერთოდ არ გიფიქრია. შიჰიპარის განმარტებით, „როცა შენს უცნობებს არ ითვალისწინებ, ორივე მიმართულებით მარცხდები". მისივე თქმით, მხოლოდ წინასწარ დაგეგმვა საკმარისი არ არის, ვინაიდან უცნობი საკითხები შესაძლოა იმპლემენტაციის სიღრმეში ამოტივტივდეს. შიჰიპარი მიუთითებს, რომ საუკეთესო აგენტურ კოდერებს შედარებით ცოტა უცნობი აქვთ, თუმცა მათ ყოველთვის ელოდებიან. დეველოპერი აფრთხილებს ორ უკიდურესობაზე. მეტისმეტი კონკრეტიკა რისკავს, რომ Fable 5 ინსტრუქციებს ხისტად მიჰყვეს, მაშინაც კი, როცა კურსის შეცვლა უფრო აზრიანი იქნებოდა. მეტისმეტი ბუნდოვანება კი დარგობრივ ნაგულისხმევ გადაწყვეტებს იძლევა, რომლებიც ამოცანას არ ერგება. შიჰიპარის თქმით, Claude დაგეხმარება საკუთარი უცნობების უფრო სწრაფად აღმოჩენაში. ის კოდურ ბაზებსა და ინტერნეტს მაღალი სიჩქარით ამუშავებს და უმეტეს თემაზე საშუალო მომხმარებელზე მეტი იცის. მთავარია, Claude-ს მიაწოდო კონტექსტი შენი ამოსავალი წერტილის შესახებ. ერთ-ერთ ტექნიკას შიჰიპარი „ბრმა ლაქის გავლას" უწოდებს. ამ დროს Claude-ს სთხოვ, შენი უცნობი უცნობები დაადგინოს. ეს მიდგომა განსაკუთრებით კარგად მუშაობს, როცა კოდური ბაზის უცნობ ნაწილში მუშაობ. მაგალითად, ავთენტიფიკაციის ახალი პროვაიდერის დამატებისას, სადაც კოდის მოდულებზე ცოდნა მწირია. მისივე ცნობით, ბევრი „უცნობი ცნობილის" შემცველ სფეროებში, მაგალითად ვიზუალურ დიზაინში, შიჰიპარი ბრეინსტორმინგსა და პროტოტიპირებას გვირჩევს. იმპლემენტაციაში ჩახტომის ნაცვლად, ის Claude-ს ავალებს რამდენიმე რადიკალურად განსხვავებული დიზაინის მიმართულების შექმნას, რომ მათზე რეაგირება შეძლოს. სხვა ტექნიკებს შორის შიჰიპარი ასახელებს სტრუქტურირებულ ინტერვიუებს, სადაც Claude მომხმარებელს კითხვა-კითხვით ეკითხება ბუნდოვან საკითხებზე. ის პრიორიტეტს ანიჭებს იმ კითხვებს, რომელთა პასუხიც არქიტექტურას შეცვლიდა. შიჰიპარის თქმით, საწყისი კოდი საუკეთესო მაგალითია, თუნდაც სხვა ენაზე იყოს დაწერილი. იმპლემენტაციის დროსაც არსებობს უცნობები. შიჰიპარი Claude Code-ს ავალებს, აწარმოოს დროებითი ფაილი, სადაც მიღებულ გადაწყვეტილებებს აღრიცხავს. მოულოდნელი შემთხვევებისას Claude-მა კონსერვატიული ვარიანტი უნდა აირჩიოს, გადახრა დააფიქსიროს და მუშაობა გააგრძელოს. იმპლემენტაციის შემდეგ შიჰიპარი 2 ტექნიკას გვთავაზობს. პირველი „ახსნა-განმარტებებია", ანუ დოკუმენტები დაინტერესებული მხარეებისთვის. მეორე „ვიქტორინებია", სადაც Claude ქმნის ცვლილებების HTML ანგარიშს, რასაც ტესტი მოსდევს. შიჰიპარის თქმით, ის კოდს არ აერთიანებს, სანამ ტესტს 0 ხარვეზით არ ჩააბარებს. შიჰიპარმა ეს ტექნიკები Fable-ის სარეკლამო ვიდეოს მაგალითზე აჩვენა, რომელიც მთლიანად Claude Code-ით დაამონტაჟა. ვიდეომონტაჟი მისთვის ახალი სფერო იყო. მან ვინმეს ახსნევინა, თუ როგორ მუშაობს ტრანსკრიფცია Whisper-ით და შესაძლებელი იყო თუ არა პაუზების ffmpeg-ით ზუსტად ამოჭრა. UI ელემენტების დროში კონტროლირებული გამოჩენისთვის მან პროტოტიპი Remotion-ით ააგო. როცა ფერი მკრთალი აღმოჩნდა, მან Claude-ს ჯერ საკუთარი თავი ასწავლინა ფერების კორექციაში, ვარიანტების ბრმად შეფასების ნაცვლად, რაც ბრმა ლაქის აღმოჩენის მისივე პრინციპს ეხმიანება. შიჰიპარის თქმით, ეს მიდგომა რეალურ პროექტებში დროს ზოგავს და საბოლოო შედეგის ხარისხს აუმჯობესებს. მოდელების გაძლიერებასთან ერთად, უფრო მეტის მიღწევა ხდება შესაძლებელი. შიჰიპარის თქმით, „ყოველი ახსნა-განმარტება, ბრეინსტორმი, ინტერვიუ, პროტოტიპი და მაგალითი იაფი გზაა იმის აღმოსაჩენად, რაც არ იცოდი, სანამ მისი გამოსწორება ძვირი გახდება".

Anthropic developer shares prompting tips for Fable 5 that focus on finding your own blind spots first
22 ივლ 20269
Anthropic's Fable 5 is back worldwide after a two-week government ban over a jailbreak
the-decoder.com

🤖 Anthropic-ის Fable 5 ორკვირიანი აკრძალვის შემდეგ გლობალურად დაბრუნდა

ტექნოლოგიურმა გიგანტმა Anthropic-მა თავისი მეორე ყველაზე ძლიერი ხელოვნური ინტელექტის მოდელი Fable 5 მთელ მსოფლიოში ხელმისაწვდომი გახადა. ორკვირიანი იძულებითი პაუზა, რომელიც ამერიკის შეერთებული შტატების მთავრობის საექსპორტო აკრძალვით იყო განპირობებული, დღეს ოფიციალურად დასრულდა. მომხმარებლებს უკვე შეუძლიათ გამოიყენონ აღნიშნული სისტემა სხვადასხვა პლატფორმაზე, მათ შორის Claude.ai-ზე, Claude Code-სა და Claude Cowork-ის ინტერფეისებში. მედიასაშუალება The Decoder-ის ინფორმაციით, შეზღუდვების მოხსნის გადაწყვეტილება მას შემდეგ მიიღეს, რაც მოდელის უსაფრთხოების ფილტრები მნიშვნელოვნად გაძლიერდა. თავდაპირველი აკრძალვის მიზეზი გახდა Amazon-ის მკვლევრების მიერ აღმოჩენილი სერიოზული დაცვის ხარვეზი. მათი დასკვნით, Fable 5-ის უსაფრთხოების ბარიერების გვერდის ავლით შესაძლებელი იყო სხვადასხვა პროგრამული სუსტი წერტილის იდენტიფიცირება და შესაბამისი კოდის გენერირება. ჟურნალისტი მათიას ბასტიანი თავის სტატიაში დეტალურად აღწერს იმ საფრთხეებს, რომლებმაც სახელმწიფო უწყებების შეშფოთება გამოიწვია. მოდელმა შეძლო პროგრამული ხარვეზების პოვნა და ერთ-ერთ ტესტში აჩვენა, თუ როგორ უნდა მომხდარიყო ამ ხარვეზის რეალური გამოყენება მავნე მიზნებისთვის. სწორედ ამ ინციდენტის გამო კომპანიამ სასწრაფო წესით შეაჩერა უცხოელი მომხმარებლებისთვის სისტემის მიწოდება. კომპანიის წარმომადგენელმა განმარტა, რომ აბსოლუტურად გაუმტარი ხელოვნური ინტელექტის შექმნა პრაქტიკულად შეუძლებელია. მან განაცხადა: „ალბათ სრულიად შეუძლებელია ისეთი მოდელის შექმნა, რომელიც აბსოლუტურად დაცული იქნება გვერდის ავლის მცდელობებისგან“. ამის მიუხედავად, კომპანიის სპეციალისტებმა შეიმუშავეს ახალი უსაფრთხოების კლასიფიკატორი, რომელიც Amazon-ის მოხსენებაში აღწერილ ტექნიკას შემთხვევათა 99%-ში ბლოკავს. დამატებითმა კვლევებმა აჩვენა, რომ ანალოგიური სუსტი წერტილების აღმოჩენა სხვა შედარებით სუსტ მოდელებსაც შეეძლოთ. ტესტირებაში მონაწილეობდნენ ისეთი სისტემები, როგორიცაა Claude Opus 4.8, GPT-5.5 და Kimi K2.7. თუმცა, კონკრეტული ექსპლოიტის დემონსტრირებისას, ყველა შემოწმებულმა მოდელმა, მათ შორის ბევრად მცირე ზომის Claude Haiku 4.5-მაც კი, აჩვენა ზუსტად იდენტური შედეგი, რაც პრობლემის მასშტაბზე მიუთითებს. ახალ დაცვის ფილტრს თან ახლავს გარკვეული უარყოფითი მხარეებიც, რაც მომხმარებელთა უკმაყოფილებას იწვევს. გაუმჯობესებული სისტემა ხშირად ბლოკავს სრულიად უსაფრთხო პროგრამულ მოთხოვნებს ყოველდღიური კოდირების ან დეველოპმენტის დროს. კომპანიის მონაცემებით, ახალი დაცვის ზღვარი ბევრად უფრო ფართოა, რაც ზრდის უსაფრთხოებას, მაგრამ ამავე დროს ზღუდავს დეველოპერების თავისუფალ მუშაობას. დეტალური გეგმის მიხედვით, Fable 5 მოდელზე წვდომა ამჟამად გათვალისწინებულია Pro, Max, Team და Enterprise გეგმების მომხმარებლებისთვის 7 ივლისამდე. ამ პერიოდში მათ შეეძლებათ გამოიყენონ თავიანთი ყოველკვირეული ლიმიტის 50%-მდე, ხოლო ამ ვადის გასვლის შემდეგ ანგარიშსწორება მოხდება მოხმარებული კრედიტების საფუძველზე. ღრუბლოვან სერვისებზე, როგორიცაა AWS და Google Cloud, წვდომა უახლოეს პერიოდში აღდგება. პარალელურად, მოდელის შედარებით ნაკლებად შეზღუდული ვერსია Mythos 5 კვლავ მკაცრი კონტროლის ქვეშ რჩება. ამ ვერსიით სარგებლობა მხოლოდ ამერიკულ ორგანიზაციებს შეუძლიათ, რომლებმაც სახელმწიფო ნებართვა 26 ივნისს მიიღეს. კომპანია აგრძელებს მუშაობას ხელისუფლებასთან, რათა გააფართოოს პარტნიორთა წრე Glasswing პროგრამის ფარგლებში, თუმცა ევროკავშირის ამ ინიციატივაში ჩართვა კვლავ გაურკვეველია. უსაფრთხოების ექსპერტები თანხმდებიან, რომ ინდუსტრიას სჭირდება ერთიანი სტანდარტები გვერდის ავლის შემთხვევების შესაფასებლად. Anthropic ახლა აქტიურად მუშაობს Microsoft-თან, Google-თან და Amazon-თან ერთად ასეთი ჩარჩოს შესაქმნელად. გარდა ამისა, კომპანიამ გახსნა სპეციალური HackerOne პროგრამა, სადაც მკვლევრებს შეუძლიათ შეატყობინონ უსაფრთხოების ახალი ხარვეზების შესახებ და მიიღონ შესაბამისი ჯილდო. საბოლოო ჯამში, ტექნოლოგიური გიგანტი აფართოებს თანამშრომლობას ამერიკის შეერთებული შტატების მთავრობასთან უსაფრთხოების მიმართულებით. კომპანია იღებს ვალდებულებას, რომ სახელმწიფო უწყებებს მიაწოდოს მოდელებზე წინასწარი წვდომა მათ ოფიციალურ გამოშვებამდე. ეს საშუალებას მისცემს კიბერუსაფრთხოების სპეციალისტებს, დროულად მოახდინონ რეაგირება შესაძლო საფრთხეებზე და დაიცვან ციფრული ინფრასტრუქტურა. კიბერუსაფრთხოების ექსპერტების შეფასებით, მთავრობის ჩართულობა ხელოვნური ინტელექტის გამოშვებაში უნდა იყოს გამჭვირვალე და პროგნოზირებადი. კომპანია მზად არის გამოყოს მნიშვნელოვანი გამოთვლითი რესურსები ერთობლივი კვლევებისთვის. ეს ხელს შეუწყობს იმის უზრუნველყოფას, რომ კიბერდამცველებს ჰქონდეთ საჭირო ინფორმაცია ძლიერი მოდელების მუშაობის შესახებ და შეძლონ ეფექტური უსაფრთხოების ზომების დროული შემუშავება.

Anthropic's Fable 5 is back worldwide after a two-week government ban over a jailbreak
1 ივლ 20269

All insights loaded