Optik karakter tanıma (OCR) artık fiş tarama, kimlik doğrulama, fatura otomasyonu, tarihi arşiv dijitalleştirme ve kalem tabanlı not uygulamalarına güç veriyor. OCR pazarının 2030 yılına kadar %14.8'lik yıllık bileşik büyüme oranıyla (Grand View Research, 2024) 32.90 milyar dolara ulaşması bekleniyor; en hızlı büyüyen alan ise akıllı karakter tanıma (OCR'nin el yazısı okuma dalı) olacak. İster belge ayrıştırma, ister sahne metni tespiti veya el yazısı transkripsiyonu geliştiriyor olun, eğitim için kullandığınız OCR veri seti doğruluk sınırınızı belirler. Bu kılavuz, kullanım durumuna göre düzenlenmiş ve 2024 yılına kadar en güçlü sürümlerle güncellenmiş, en iyi el yazısı veri setleri de dahil olmak üzere 22 ücretsiz, açık kaynaklı OCR veri setini kapsamaktadır.
Önemli Noktalar
- OCR (Optik Karakter Tanıma): Basılı, sahne veya el yazısı metin görüntülerinin makine tarafından okunabilir verilere dönüştürülmesini sağlayan teknoloji.
- OCR veri kümeleri beş gruba ayrılmıştır: belge/form, sahne metni, rakam/karakter, el yazısı ve çok dilli.
- Belge OCR veri kümeleri Formlar ve makbuzlar gibi yapılandırılmış sayfaları yakalayın; sahne-metin veri kümeleri "Doğal ortamda" metin yakalama.
- IAM, MNIST, ICDAR ve SROIE, araştırmalarda en çok atıfta bulunulan OCR kıyaslama ölçütleri olmaya devam ediyor.
- Lisans koşulları büyük ölçüde değişiklik göstermektedir; ticari eğitime başlamadan önce her OCR veri setini doğrulayın.
OCR (Optik Karakter Tanıma) Nedir?
OCR, taranmış kağıt belgeler, PDF'ler veya metin görüntüleri gibi farklı türdeki belgeleri düzenlenebilir ve aranabilir verilere dönüştüren bir teknolojidir. Şu şekilde çalışır:
- Bir görüntüdeki metnin yapısını analiz etme
- Metni satırlara ve karakterlere ayırma
- Bu görsel karakterleri makine tarafından okunabilen metne dönüştürmek
Yaygın kullanımlar şunları içerir:
- Taranan belgelerin düzenlenebilir metin dosyalarına dönüştürülmesi
- Basılı kitapların dijitalleştirilmesi
- Fotoğraflardan metin çıkarma
- El yazısıyla yazılmış reçetelerin dijital metne dönüştürülmesi
- Plaka tanıma
Doğru OCR veri setini nasıl seçersiniz?
Bir OCR veri kümesi seçimi dört faktöre bağlıdır: metin türü, yakalama ortamı, açıklama ayrıntı düzeyi ve lisans. Basılı belge OCR'ı, el yazısı veya kavisli sahne metninden farklı eğitim verilerine ihtiyaç duyar. Belge veri kümeleri faturalar, formlar ve makbuzlar için uygundur; sahne metni veri kümeleri tabelalar ve ürün okuma için uygundur; el yazısı veri kümeleri notlar, el yazmaları ve kalem girişi için uygundur. Kelime düzeyinde ve satır düzeyinde açıklamalar tam OCR işlem hatlarını desteklerken, karakter düzeyindeki kümeler sınıflandırma temellerine uygundur. Bazı OCR veri kümeleri yalnızca araştırma amaçlıdır veya kayıt gerektirir, bu nedenle lisans koşullarını her zaman doğrulayın.
En iyi belge ve form OCR veri kümeleri hangileridir?
Belge OCR veri kümeleri, faturalar, formlar, makbuzlar ve kimlikler gibi yapılandırılmış sayfaları ayrıştırmak için modelleri eğitir. Bunlar, iş belgelerinin otomasyonunu ve anahtar-değer çıkarımını güçlendirir.
- FONSD — Gürültülü, gerçek dünya görünümüne sahip 199 adet açıklama eklenmiş taranmış form. Form anlama ve anahtar-değer çıkarımı için standart ölçüt.
- SROİE — ICDAR 2019 taranmış fiş veri seti, yaklaşık 1,000 fişten oluşmakta olup, tek bir sette metin tespiti, tanıma ve bilgi çıkarımını desteklemektedir.
- KORDON — Fatura ve makbuz otomasyonu için zengin alan düzeyinde etiketler içeren, OCR sonrası ayrıştırmaya yönelik olarak oluşturulmuş birleştirilmiş bir makbuz veri seti.
- XFUND — FUNSD'nin yedi dili (Almanca, İspanyolca, Fransızca, İtalyanca, Japonca, Portekizce, Çince) kapsayan ve her biri 199 sayfadan oluşan çok dilli uzantısı. Çok dilli belge yapay zekası için idealdir.
- DDI-100 — Gerçek dünya koşullarındaki bozulmalar (eğilme, bulanıklık ve gürültü gibi) altında tespit ve tanıma için yaklaşık 100,000 adet bozulmuş belge görüntüsü.
En iyi sahne metni OCR veri kümeleri hangileridir?
Sahne-metin OCR veri kümeleri, tabelalar, ürünler ve sokak manzaraları gibi doğal görüntülerdeki metinleri okumak için modelleri eğitir. Bunlar, arka planların karmaşık olduğu gerçek dünya OCR uygulamaları için çok önemlidir.
- ICDAR Sağlam Okuma — Odaklanmış ve Rastgele Sahne Metni zorlukları da dahil olmak üzere, kelime düzeyinde sınırlayıcı kutular ve transkripsiyonlar içeren sahne metni araştırmalarının çoğunun temelini oluşturan referans aile.
- COCO-Metin — MS-COCO görüntülerine katmanlandırılmış büyük ölçekli sahne-metin açıklamaları. Doğal sahnelerde büyük ölçekte metin tespiti için güçlüdür.
- Toplam Metin — Özellikle eski OCR modellerinin bilinen bir zayıf noktası olan kavisli ve rastgele yönlendirilmiş metinlerde uzmanlaşmıştır.
- SVT (Sokak Görünümü Metni) — Google Street View'dan alınan, genellikle düşük çözünürlüklü ve yüksek değişkenlik gösteren Word görselleri. Papers with Code aynaları aracılığıyla erişilebilir.
- HierText — Paragraftan satıra, satırdan kelimeye hiyerarşik açıklama sistemi; hem el yazısı hem de basılı sahne metinlerini kapsar. Düzenlemeye duyarlı optik karakter tanıma (OCR) için kullanışlıdır.
En iyi rakam ve karakter OCR veri kümeleri hangileridir?
Rakam ve karakter OCR veri kümeleri, kontrollü ortamlarda tek tek sembolleri tanımak için modelleri eğitir. Bunlar, sınıflandırma temelleri için standart başlangıç noktalarıdır.
- MNİST — 70,000 adet gri tonlamalı el yazısı rakam görüntüsü. Rakam sınıflandırıcıyı doğrulamak için en hızlı temel veri seti.
- EMNİST — NIST Özel Veritabanı 19'dan elde edilen 814,255 el yazısı harf ve rakamla MNIST'i genişletir.
- SVHN (Sokak Görünümü Ev Numaraları) — Ev numaralarından elde edilen 600,000'den fazla gerçek dünya rakam görüntüsü. Gürültülü koşullar için MNIST'e göre pratik bir adım öteye geçiş.
- Chars74K — Doğal görüntülerden ve bilgisayar yazı tiplerinden elde edilen İngilizce ve Kannada karakterlerini kapsayan 74,107 görsel.
- NIST Özel Veritabanı 19 — 3,600 yazardan 810,000'den fazla el yazısı karakter görüntüsü. Birçok İngilizce OCR performans testinin kaynağı.
Optik karakter tanıma (OCR) için en iyi el yazısı veri kümeleri hangileridir?
El yazısı veri kümeleri, optik karakter tanıma (OCR) modellerini el yazısı, basılı ve tarihi el yazısı metinleri okumak üzere eğitir. En güçlü açık kaynaklı el yazısı veri kümeleri, el yazısı metin tanıma (HTR) için en çok alıntı yapılan kıyaslama ölçütleri olmaya devam etmektedir.
- IAM El Yazısı Veritabanı — 657 yazardan 13,353 metin satırı içeren, İngilizce el yazısı konusunda altın standart. 2024-2025 OCR araştırmalarında hala en çok alıntı yapılan el yazısı veri seti.
- IAM-OnDB — IAM'nin çevrimiçi kalem vuruşu sürümü, yörünge verilerini yakalar. Kalem ve tablet tanıma için standart el yazısı veri kümesi.
- Bentham Belgeleri — Filozof Jeremy Bentham'ın tarihi İngilizce el yazmalarının transkripsiyonu. Tarihi el yazısı optik karakter tanıma (OCR) alanında önde gelen referans noktası, Transkribus aracılığıyla erişilebilir.
- GNHK (GoodNotes El Yazısı Koleksiyonu) — 2021 yılına ait, kısıtlama olmaksızın gerçek dünyadan alınmış el yazısı İngilizce notlardan oluşan bir veri seti. Laboratuvar ortamında temizlenmiş kimlik ve erişim verilerinden ziyade, dağınık üretim verilerine daha yakın.
En iyi çok dilli ve Latin olmayan OCR veri kümeleri hangileridir?
Çok dilli OCR veri kümeleri, İngilizce'nin ötesindeki Çince, Arapça ve matematiksel gösterim gibi yazı sistemleri üzerinde modelleri eğitir. Bunlar, küresel belge ve el yazısı tanıma için çok önemlidir.
- CASIA-HWDB — 1,020 yazardan alınan 1.17 milyon el yazısı karakter örneğiyle oluşturulan standart Çince OCR ölçütü.
- KHATT — 1,000 farklı yazardan 1,000 adet Arapça el yazısı formu, birden fazla çözünürlükte taranmıştır. En kapsamlı açık kaynaklı Arapça OCR veri seti.
- CROHME — Çevrimiçi El Yazısı Matematiksel İfadelerin Tanınması Yarışması: Hem çevrimiçi hem de çevrimdışı varyantlarda 101'den fazla matematik sembolüyle 10,000'den fazla ifade. El yazısı denklem OCR'ı için vazgeçilmezdir.
Ücretsiz OCR veri kümelerini kullanırken karşılaşılan yaygın tuzaklar nelerdir?
Çoğu takımın başına gelen üç tuzak var.
Alan uyumsuzluğu: Temiz IAM veya COCO-Text üzerinde eğitim alıp buruşuk faturalar üzerinde uygulama yapmak, düşük doğruluk oranını garanti eder.
Lisans körlüğü: Birçok sahne-metin ve tarihi OCR veri seti yalnızca araştırma amaçlıdır veya ticari kullanım öncesinde kayıt gerektirir.
Ek açıklama eksiklikleri: birçok OCR veri kümesinde, üretim sistemlerinin ihtiyaç duyduğu düzen meta verileri, satır düzeyinde sınırlayıcı kutular veya alan etiketleri bulunmamaktadır.
Orta ölçekli bir lojistik firmasının kargo etiketlerini okuma işlemini otomatikleştirdiğini düşünün. Genel kullanıma açık metin tabanlı eğitimler, kıyaslama testlerinde %80'lik bir başarı oranına ulaşmalarını sağlıyor, ancak parlama ve katlanma izleri olan gerçek etiketlerde bu oran %58'e düşüyor. Bu açığı kapatmak için, lansmandan önce 6,000 adet kendi alanında kullanılan etiket görüntüsünün hedefli veri etiketlemesi yapılması gerekiyordu.
Açık Kaynak Veri Kümelerinin Faydaları ve Zorlukları

İşletmelerin, makine öğrenimi uygulamaları için kullanımı ücretsiz verileri seçmeleri gerekip gerekmediğini anlamak için avantajları ve zorlukları birbirine düşürmesi gerekir.
Faydalar
- Verilere kolayca erişilebilir. Veri kullanılabilirliği nedeniyle, uygulamayı geliştirme maliyeti önemli ölçüde azalır.
- Veri kümesi hazır olduğundan, uygulama için veri toplamak için harcanan zaman ve çaba önemli ölçüde azalır.
- Veri kümesini öğrenmeye, uyarlamaya ve optimize etmeye yardımcı olan çok sayıda topluluk forumu veya yardım grubu vardır.
- Açık kaynaklı veri setinin en büyük avantajlarından biri, kişiselleştirme konusunda herhangi bir kısıtlama getirmemesidir.
- Açık Kaynaklı verilere nüfusun büyük bir kesimi tarafından erişilebilir, bu da parasal engeller olmaksızın analiz ve inovasyonu mümkün kılar.
Meydan Okumalar
- Projeye özel verilerin elde edilmesi zordur. Ek olarak, eksik bilgi ve mevcut verilerin yanlış kullanılması olasılığı vardır.
- Tescilli verileri elde etmek zaman ve çaba gerektirir ve maliyetlidir
- Veri elde etmek daha kolay olsa da, bilgi ve analiz maliyeti başlangıçtaki avantajdan daha ağır basabilir.
- Diğer geliştiriciler de uygulamaları geliştirmek için aynı verileri kullanır.
- Bu veri kümeleri, güvenlik ihlallerine, mahremiyete ve rızaya karşı oldukça savunmasızdır.
Shaip, optik karakter tanıma (OCR) ve el yazısı tanıma projelerini nasıl destekliyor?
Shaip'in OCR eğitim veri hizmetleri , basılı belgeler, el yazısı, makbuzlar ve kimlikler de dahil olmak üzere 60'tan fazla dilde açık veri kümesi derlemesini özel veri toplama ile birleştirir . Shaip'in açıklama iş akışları, kamuya açık OCR veri kümelerinin eksik bıraktığı katmanları ekler: satır düzeyinde sınırlayıcı kutular, alan düzeyinde etiketler, transkripsiyon kalite kontrolü ve yazar meta verileri.
Sonuç
Yukarıdaki 22 OCR veri seti, 2026 yılı için belge, sahne metni, rakam, el yazısı ve çok dilli tanıma alanlarında eksiksiz bir açık kaynak temeli sunar. Metin türünüze ve yakalama ortamınıza uygun OCR veri setiyle başlayın, gerçek verilerinizin ayrılmış bir örneğiyle doğrulayın ve alan boşluğunu kapatmak için özel ek açıklamalar için bütçe ayırın. Bu kombinasyon, sıfırdan oluşturmaktan daha hızlı sonuç verir.
Makine öğrenimi için en iyi ücretsiz OCR veri seti hangisidir?
En iyi ücretsiz OCR veri seti, yapılacak işe bağlıdır. ICDAR Robust Reading, sahne metni için önde gelen veri setidir; FUNSD ve SROIE, belge ve fiş OCR'ı için önde gelen veri setleridir; IAM ise el yazısı için önde gelen veri setleridir. Rakam tanıma için MNIST ve SVHN standart veri setleridir. Çoğu ekip, tek bir veri setine güvenmek yerine, kategoriler arasında iki veya üç OCR veri setini birleştirir.
Açık kaynaklı OCR veri kümeleri ticari kullanım için ücretsiz midir?
Açık kaynaklı OCR veri kümelerinin tamamı ticari kullanım için ücretsiz değildir. MNIST, SVHN ve COCO-Text izin verici lisanslar kullanırken, IAM, ICDAR setleri ve tarihi el yazısı veri kümeleri genellikle kayıt gerektirir veya kullanımı araştırma ile sınırlandırır. Ticari bir model eğitmeden önce her veri kümesinin lisansını mutlaka inceleyin.
OCR veri kümeleri ile el yazısı veri kümeleri arasındaki fark nedir?
OCR veri kümeleri, basılı belgeler, sahne metinleri ve rakamlar dahil olmak üzere makine tarafından okunabilir tüm metin tanıma işlemlerini kapsarken, el yazısı veri kümeleri ise el yazısı içeriğine odaklanan alt kümedir. IAM ve Bentham gibi el yazısı veri kümeleri HTR modellerini eğitirken, belge ve sahne metni OCR veri kümeleri basılı ve gerçek dünyadaki metinleri ele alır.
Hangi OCR veri kümeleri çok dilli tanımayı destekliyor?
Çok dilli OCR veri kümeleri arasında yedi dildeki formlar için XFUND, Çince için CASIA-HWDB, Arapça için KHATT ve çok dilli sahne metni için ICDAR MLT yer almaktadır. Yazı sistemine özgü OCR veri kümelerinin sentetik veri artırma ile birleştirilmesi, genellikle tek başına herhangi bir veri kümesi üzerinde eğitim yapmaktan daha iyi sonuç verir.
Ücretsiz OCR veri setlerinin ötesinde ne kadar özel açıklamaya ihtiyacım var?
Özel açıklama ihtiyacı, belgelerinizin kamuya açık verilerden ne kadar uzak olduğuna bağlıdır. Temiz basılı formlar için 1,000-5,000 adet yerel örnek gerekebilirken, dağınık el yazısı, makbuzlar veya nadir yazı tipleri için genellikle 10,000-50,000 örnek gerekir. Shaip'in açıklama işlem hatları, genellikle yalnızca kamuya açık OCR eğitimine kıyasla %15-30'luk bir doğruluk artışı sağlar.