Andrew Altair
  • ბლოგი
  • ინსაითები
  • ფორუმი
  • პრომპტები
  • ბოტები
  • სერვისები
Andrew Altair

© 2026 Andrew Altair

aiNOW · AI სააგენტო

Insights

მოკლე ანალიტიკა და კომენტარები AI სამყაროდან

English →
All#ai#openai#big-tech#anthropic#tech-industry#ai-agents#OpenAI#autonomous-systems#gpt#google#Anthropic#startup#claude#automation#meta
Old OCR text cripples language model training, and FineBooks wants to fix that at scale
the-decoder.com

📊 FineBooks-ის პროექტმა ძველი ტექსტების OCR დამუშავების ახალი მოდელები გამოსცადა

Hugging Face-ისა და EleutherAI-ს ერთობლივმა პროექტმა, სახელწოდებით FineBooks, ღია კოდის მქონე 14 OCR მოდელი გამოსცადა. ტესტირება ისტორიული წიგნების 2165 გვერდზე ჩატარდა. კვლევის მიზანია ენობრივი მოდელების სწავლებისთვის ძველი ტექსტების ხარისხის გაუმჯობესება. პროექტის შედეგები AI საზოგადოებისთვის უკვე ხელმისაწვდომია. ახალი ბენჩმარკი ინდუსტრიაში მნიშვნელოვან ნაბიჯად შეფასდა. მონაცემთა ბაზების გაუმჯობესება პრიორიტეტულია. საჯარო დომენში არსებული ძველი წიგნების გაციფრულება ხშირად ცდომილებებით მიმდინარეობდა. Talkie პროექტის მონაცემებით, ძველი OCR სისტემით დამუშავებულ ტექსტებზე სწავლებისას მოდელის ეფექტიანობა 30%-მდე მცირდება, ადამიანის მიერ აკრეფილ ტექსტებთან შედარებით. ეს ხარვეზი AI მოდელების ხარისხს მნიშვნელოვნად აქვეითებდა. მონაცემთა ხარისხი მოდელებისთვის მნიშვნელოვანია. ცდომილებების აღმოფხვრა აუცილებელი გახდა. FineBooks-ის ჯგუფმა განმარტა, რომ თანამედროვე ღია მოდელები ამ პრობლემას წარმატებით ებრძვის. საუკეთესო მოდელებმა სიმბოლოების 97%-იანი სიზუსტე აჩვენეს. ამასთან, 1000 გვერდის დამუშავების ღირებულება 2 დოლარზე ნაკლები აღმოჩნდა. ფინანსური ხელმისაწვდომობა პროექტის მთავარი უპირატესობაა. დაბალი ხარჯები მასშტაბურ გაციფრულებას შესაძლებელს ხდის. ტექნოლოგიური პროგრესი აშკარაა. გასულ წელს გამოქვეყნებული Common Pile კოლექცია 300 000 დასახელების წიგნს შეიცავდა, რომლებიც ძველი OCR ტექნოლოგიით იყო დამუშავებული. მკვლევართა თქმით, ამ ტექსტების ხელახალი დამუშავება AI მოდელების სწავლების ხარისხს მნიშვნელოვნად გაზრდის. ახალი მონაცემთა ბაზები AI სისტემებს გააუმჯობესებს. ღია კოლექციები მკვლევარებს დიდად ეხმარება. სწავლების პროცესი უფრო ეფექტიანი გახდება. პროექტის პირველ სამიზნედ Biodiversity Heritage Library (BHL) დასახელდა, რომელიც 300 000-ზე მეტ დოკუმენტს და 64 მილიონზე მეტ გვერდს მოიცავს. ბიბლიოთეკის ეს არქივი ხელმისაწვდომია AWS პლატფორმის მეშვეობით. სპეციალისტებმა განაცხადეს, რომ ამ მონაცემების განახლება იგეგმება. მასშტაბური გაციფრულება ბიოლოგიურ კვლევებსაც შეუწყობს ხელს. არქივების განახლება აქტიურად მიმდინარეობს. მეცნიერული ბაზა გაფართოვდება. ექსპერტმა აღნიშნა, რომ ბაზა განახლდება. სიზუსტის შესაფასებლად IMPACT-ისა და BHL-Europe-ის 2011-2012 წლების მონაცემთა ბაზა გამოიყენეს. ექსპერტებმა 6 ტომი ხელით გადაიყვანეს ციფრულ ფორმატში. ამ ბაზაში ცდომილება ყოველ 2000 სიმბოლოზე მხოლოდ 1 შეცდომას შეადგენდა. ეს მონაცემები ეტალონად იქნა გამოყენებული. ტესტირების მეთოდოლოგია მაღალი სიზუსტით გამოირჩევა. შედეგები სრულ ნდობას იმსახურებს. ტესტირებულ მოდელებს შორის საუკეთესო შედეგი dots.mocr მოდელმა აჩვენა, რომელიც 3 მილიარდ პარამეტრს შეიცავს. მან გადაასწრო Qwen3.5-9B მოდელს, რომელიც სამჯერ უფრო დიდია. მეორე ადგილზე 0,9-მილიარდიანი OvisOCR2 გავიდა, რომლის ხარჯი 1000 გვერდზე 0.46 დოლარია. მოდელის ზომა ყოველთვის არ განსაზღვრავს ხარისხს. პატარა მოდელები ხშირად ეფექტიანია. არქიტექტურა მნიშვნელოვან როლს თამაშობს. მკვლევარებმა დაადასტურეს: „ენობრივი მოდელების სწავლებისთვის წამყვანი OCR სისტემების შედეგები სრულიად საკმარისია". მათ დასძინეს, რომ ახალი მოდელები ძველ სისტემებთან შედარებით ბევრად ნაკლებ შეცდომას უშვებს. ექსპერტები მიღებულ შედეგებს მაღალ შეფასებას აძლევენ. AI სწავლების ხარისხი იზრდება. ოპტიმიზაცია წარმატებით განხორციელდა. თუმცა სამეცნიერო ბიბლიოთეკებისთვის ეს მოდელები ჯერ მზად არ არის, რადგან ALTO XML ფორმატს არ უჭერს მხარს. გარდა ამისა, მოდელები არქაულ ასოებს ავტომატურად უცვლის თანამედროვე ექვივალენტებს. ამ ხარვეზის გამოსასწორებლად დამატებითი ტუნინგია საჭირო. ბიბლიოთეკარები დამატებით ფუნქციონალს ითხოვენ. ტექნიკური გაუმჯობესება გრძელდება. ფორმატების თავსებადობა მისაღწევია. ექსპერტთა შეფასებით, ძველი ტექსტების მაღალი ხარისხით დამუშავება ღია მოდელების კონკურენტუნარიანობას გაზრდის. მრავალენოვანი არქივების სწორი გაციფრულება ხელოვნური ინტელექტის ბაზებს გამდიდრების საშუალებას მისცემს. ეს პროცესი გლობალურ AI განვითარებას წაადგება. მონაცემთა ხელმისაწვდომობა იზრდება. ინდუსტრია ახალ ეტაპზე გადადის. FineBooks-ის გუნდი BHL-ის 200 000 დოკუმენტის ხელახალ დამუშავებას და ღია მონაცემთა ბაზის გამოქვეყნებას გეგმავს. პროექტის შედეგები AI ინდუსტრიას მაღალი ხარისხის სასწავლო მასალას მიაწვდის. სიახლეები რეგულარულად განახლდება. პროექტი წარმატებით გრძელდება. სამომავლო გეგმები უკვე გაწერილია და სამუშაოები აქტიურად მიმდინარეობს.

#FineBooks#Hugging-Face#EleutherAI
Old OCR text cripples language model training, and FineBooks wants to fix that at scale
11 აგვ 20262

All insights loaded