FineBooks benchmarks 14 open OCR models on historical texts to fix LLM

A joint initiative by Hugging Face and EleutherAI titled FineBooks evaluated 14 open-source OCR models across 2,165 historical book pages to solve data degradation in LLM pre-training corpora. Legacy OCR errors on public domain books have been shown to degrade language model efficiency by up to 30% compared to clean text.
The benchmark revealed that modern vision-language models achieve over 97% character accuracy at a processing cost under $2 per 1,000 pages. The top performer was dots.mocr, a 3-billion parameter model that outperformed models three times its size, followed by OvisOCR2 operating at just $0.46 per 1,000 pages.
The project aims to re-process massive open archives like the Biodiversity Heritage Library's 64 million pages, making high-quality historical texts available for open-source AI training without relying on degraded scans.
Old OCR text cripples language model training, and FineBooks wants to fix that at scale
the-decoder.com
დაწვრილებით ამ თემაზე

🤑 Google-მა სული გაყიდა
Google-ის AI ოფიციალურად გადაიქცა სარეკლამო ბილბორდად. კომპანიამ დაიწყო რეკლამების გაყიდვა Gemini-სა და Search AI-ში. თქვენი კითხვები ახლა მხოლოდ გაყიდვების საბაბია.

🥕 რა სჯობს ნამდვილ სტაფილოს?
Bandcamp-მა ხელოვნური ინტელექტით შექმნილი მუსიკა აკრძალა — პლატფორმა პრიორიტეტს ადამიანურ შემოქმედებას ანიჭებს. ინდი-მუსიკის უკანასკნელი ბასტიონი, Bandcamp, ოფიციალურად აცხადებს ომს ალგორითმული "ხმაურის" წინააღმდეგ. პლატფორმა კრძალავს ნებისმიერ კომპოზიციას, რომელიც AI-მ დააგენერირა. ეს გადაწყვეტილება სასოწარკვეთილი და, ამავდროულად, გენიალური ბიზნეს სვლაა იმ ეპოქაში, სადაც Spotify და სხვა გიგანტები ნაგავსაყრელად იქცნენ. მაშინ როცა მეინსტრიმ პლატფორმები თვალს ხუჭავენ "Velvet Sundown"-ის მსგავს ფეიკ-ჯგუფებზე და ეგუებიან ალგორითმულ მანიპულაციებს, Bandcamp ქმნის ელიტურ კლუბს - ადგილი, სადაც ადამიანის სული ჯერ კიდევ ფასობს. აქ მუსიკა ემოციაა. Spotify-სთვის AI შემოსავლის წყაროა, Bandcamp-ისთვის კი ეგზისტენციალური საფრთხე. 2026 წელს, როცა ინტერნეტი "მკვდარია" და კონტენტის 90%-ს ბოტები ქმნიან, ნამდვილი ადამიანური შეცდომები, იმპროვიზაცია და სულიერი სიღრმე პრემიუმ პროდუქტად იქცევა. ეს აკრძალვა რეალურად ხარისხის კონტროლის უმაღლესი სტანდარტია — ისინი ყიდიან არა უბრალოდ აუდიო ფაილებს, არამედ გარანტიას. თქვენს ყურსასმენებში ნამდვილი გული ძგერს. მომხმარებლების რეაქციაც შესაბამისია — "ჯოჯოხეთური ჰო" და სიხარული, რადგან ხალხს მობეზრდა სუროგატი.

🚗 სწრაფი და… სულელი?
თქვენ გგონიათ, რომ 8 დოლარად მომავალი იყიდეთ, სინამდვილეში კი მხოლოდ რეკლამების სამიზნე გახდით. OpenAI-მ "ChatGPT Go" ჩაუშვა — იაფი, სწრაფი, მაგრამ "გამოშიგნული" მოდელი, რომელიც მალე რეკლამებით გაივსება. რევოლუციის ნაცვლად, ჩვენ მასობრივი წარმოების ხაფანგს ვიღებთ. ინდოეთში დაწყებული ექსპერიმენტი უკვე 170+ ქვეყანაში გავრცელდა და ახლა ყველაზე სწრაფად მზარდი სააბონენტო გეგმაა.
Related insights
Humanoid robot training centers open in China's hardware capital Yongkang Massive humanoid robot training centers, locally called "robot schools," have opened
wired.com
Five Eyes warns advanced AI cyber-weapons are months away after US blocks Anthropic's Fable Intelligence agencies from the Five Eyes alliance—comprising the US
theguardian.com
Ant Group's Ling 3.0 Flash scores 38 on AI Index with hallucination rate dropping from 97% to 44% Ant Group's inclusionAI laboratory released Ling 3.0 Flash,
the-decoder.com
Mark Zuckerberg releases 6,000-word essay on superintelligence and launches open Muse Glimmer model Meta CEO Mark Zuckerberg published a comprehensive 6,000-
theguardian.com
კომენტარები (0)
Andrew Altair
AI Innovator