OCR Nedir? Anlamı, Nasıl Çalıştığı ve Bir PDF'e Ne Zaman Gerektiği
OCR, Optik Karakter Tanıma demektir — metin görüntülerini gerçek, aranabilir metne dönüştürür. Terimin anlamı, OCR taramanın ne olduğu ve PDF'inizin buna ihtiyacı olup olmadığı.
Tek cümleyle: OCR, Optik Karakter Tanıma demektir — bir görüntünün içindeki harfleri okuyup arayabileceğiniz, seçebileceğiniz ve kopyalayabileceğiniz gerçek metne dönüştürür.
Taranmış bir PDF açıp kelimeleri seçemediğinizi ya da Ctrl+F ile arayamadığınızı fark ettiyseniz, OCR'a ihtiyaç duyan bir belgeyle karşılaşmışsınız demektir.
OCR ne demek
Kısaltma İngilizce "Optical Character Recognition" ifadesinden gelir ve parçalara ayrıldığında anlamı netleşir:
- Optik — tıpkı bir göz gibi, görüntü üzerinden çalışır.
- Karakter — tek tek harfleri, rakamları ve noktalama işaretlerini ayırt eder.
- Tanıma — her şeklin hangi karakter olma ihtimalinin en yüksek olduğuna karar verir.
Yani OCR, bir yazının fotoğrafına bakıp ne yazdığını çözme işidir. Girdisi piksel, çıktısı metindir.
PDF'te OCR ise şu anlama gelir: bir PDF ya gerçek karakterler barındırır ya da yalnızca sayfanın görüntüsünü. OCR ikinci türü alır ve görüntünün tam üstüne oturan görünmez bir gerçek metin katmanı ekler. Görsel olarak hiçbir şey değişmez — ama belge fotoğraf olmaktan çıkıp belge olmaya başlar.
OCR tarama nedir
İnsanlar çoğu zaman "OCR tarama" derken kağıttan aranabilir dosyaya giden yolun tamamını kastediyor. Aslında bu, birbirine karışan iki ayrı adımdır:
- Tarama — tarayıcı veya telefon kamerası sayfanın görüntüsünü üretir. Bu noktada bilgisayarın elinde yalnızca renkli noktalar vardır; dosyanın içinde "kelime" yoktur.
- OCR — yazılım bu görüntüyü çözümleyip içindeki karakterlerin ne olduğunu belirler.
Tarayıcı tek başına size aranabilir metin vermez. Bu terimle ilgili en yaygın yanlış anlaşılma tam olarak budur: tarayıcınız içinde arama yapamadığınız bir PDF ürettiyse, birinci adımı yapmış, ikinciyi atlamıştır.
OCR nasıl çalışır
Günümüzde OCR kabaca şu sırayla ilerler:
- Ön işleme — görüntü düzeltilir, harflerin arka plandan ayrılması için kontrast temizlenir.
- Düzen analizi — hangi bölgelerin metin, hangilerinin fotoğraf, tablo veya boşluk olduğu bulunur. Okuma sırası da burada çıkarılır: sütunlar, başlıklar, resim altı yazıları.
- Karakter tanıma — her şekil, seçilen dilde harflerin nasıl göründüğüne dair bir modelle eşleştirilir.
- Dil düzeltmesi — sözlük ve istatistiksel model, olası olmayan sonuçları düzeltir. "rn" ikilisinin genellikle "m" diye okunmamasının ve doğru dili seçmenin bu kadar önemli olmasının sebebi budur.
- Çıktı — tanınan metin, özgün görüntüyle hizalanmış görünmez bir katman olarak geri yazılır.
OCR ne zaman gerekir?
PDF görüntü tabanlıysa ve şunları istiyorsanız OCR gerekir:
- belgeyi Ctrl+F ile aramak,
- içinden metin kopyalamak,
- başka araçlara (çeviri, indeksleme, veri çıkarımı) beslemek,
- veya erişilebilirlik gereksinimlerini karşılamak — ekran okuyucular gerçek metne ihtiyaç duyar, metnin görüntüsü onlar için görünmezdir.
Word'den, tarayıcıdan veya herhangi bir uygulamadan dışa aktarılmış PDF'ler için OCR'a gerek yoktur. Bunlar zaten gerçek karakter içerir, üzerlerinde OCR çalıştırmak bir şey katmaz.
Bir PDF'in OCR'a ihtiyacı olup olmadığı nasıl anlaşılır
En hızlı test iki saniye sürer: dosyayı açın ve bir metin satırını seçmeyi deneyin.
| Ne oluyor | Ne anlama geliyor |
|---|---|
| Tek tek kelimeler vurgulanıyor | Zaten gerçek metin — OCR gerekmez |
| Tüm sayfa tek blok halinde seçiliyor ya da hiçbir şey seçilmiyor | Görüntüdür — OCR gerekir |
| Ctrl+F sayfada açıkça duran bir kelimeyi bulamıyor | Görüntüdür — OCR gerekir |
İkinci ipucu dosya boyutudur. On sayfalık bir metin PDF'i çoğunlukla 200 KB'ın altındadır; on taranmış sayfa ise genellikle birkaç megabayttır, çünkü her sayfa bir fotoğraftır.
OCR doğruluğunu ne belirler
Doğruluk büyük ölçüde OCR daha çalışmadan, görüntünün kalitesiyle belirlenir:
- Çözünürlük. 300 DPI pratikte en verimli noktadır. ~200 DPI'nin altında harfler, benzer şekilleri birbirinden ayırmak için gereken ayrıntıyı kaybeder.
- Düzgünlük. Eğri taranmış sayfalar sonucu ölçülebilir biçimde bozar. Çoğu yazılım eğriliği otomatik düzeltir ama düzgün başlamak daha iyidir.
- Kontrast ve aydınlatma. Telefon fotoğrafındaki gölgeler ya da gri bir sayfanın gri taraması, mürekkeple kağıt arasındaki sınırı bulanıklaştırır.
- Dil seçimi. Doğru dili seçmek doğru karakter kümesini ve sözlüğü devreye sokar. Bu, ç, ş, ü, ğ, ı gibi Türkçeye özgü karakterlerde çok büyük fark yaratır — yanlış dil modeliyle bunlar sıkça yanlış okunur.
- Yazı tipi ve durum. Temiz basılmış metin neredeyse kusursuz okunur. El yazısı, süslü yazı tipleri, solmuş termal fişler ve üzeri damgalanmış metinler ise çok daha zordur.
OCR'ın yapmadıkları
Beklentiyi baştan netleştirmekte fayda var, çünkü bunlar sık yaşanan sürprizler:
- PDF'i düzenlenebilir yapmaz. OCR metni aranabilir hale getirir; belgeyi düzenlenebilir paragraflara yeniden inşa etmez. Bunun için ayrı bir adım olarak PDF'i Word'e dönüştürmeniz gerekir.
- El yazısını güvenilir biçimde okumaz. El yazısı tanıma farklı bir problemdir (bazen ICR, Akıllı Karakter Tanıma diye anılır) ve sonuçlar çok değişkendir.
- Görüntüyü iyileştirmez. Sayfa neyse o kalır. OCR resmin üzerinde değil, arkasında çalışır.
- Kusursuz değildir. Temiz bir taramada hata nadirdir ama sıfır değildir. Hukuki ya da mali açıdan önemli belgelerde sonucu gözden geçirin.
Bir PDF'i aranabilir yapmak
Bir belgenin tarama olduğunu anladıktan sonra OCR çalıştırmak saniyeler sürer. Adım adım taranmış PDF'i aranabilir yapma rehberine bakın veya doğrudan OCR aracına gidin — kullanımı ücretsiz, üyelik gerekmiyor.