PDF OCR: Taranmış Belgeden Metni Çıkar
Taranmış ya da fotoğraftan oluşmuş, metni seçilemeyen bir PDF'in mi var? OCR ile sayfalardaki yazıyı tanı: metni kopyala/.txt indir ya da görünümü aynı kalan, Ctrl+F ile aranabilen bir PDF çıkar. İşlem tarayıcında olur; belge yüklenmez.
Nasıl yapılır?
- 1PDF'i seçTaranmış PDF'i alana bırak. Metin tanıma, cihazında çalışan bir motorla yapılır.
- 2Dili ve sayfaları seçTürkçe + İngilizce (varsayılan), yalnız Türkçe ya da yalnız İngilizce. İstersen sadece belirli sayfaları tara.
- 3Çıktıyı seçMetin (ekrandan kopyala / .txt indir) ya da Aranabilir PDF (görünüm aynı kalır, üstüne görünmez metin katmanı eklenir; Ctrl+F ile aranır, kopyalanır).
- 4Tanı ve indirButona tıkla; her sayfa taranır. Dil modeli ilk kullanımda bir kez indirilir, sonra internetsiz de çalışır. Sonucu kopyala ya da indir.
Başkaları yükletir, biz yükletmeyiz
Çevrim içi PDF araçlarının çoğu dosyanı kendi sunucusunda işler. Burada işlem tamamen senin tarayıcında yapılır; dilekçe, vekâletname ya da kimlik fotokopisi gibi belgeler için bu fark önemlidir.
- Yükleme yokDosya tarayıcının belleğinde işlenir; sunucuya gitmez, kopyası tutulmaz.
- Sekme donmazAğır iş arka planda ayrı bir iş parçacığında yapılır; büyük dosyalarda da sayfa akıcı kalır.
- İnternetsiz de çalışırSayfayı bir kez açtıktan sonra bağlantı kopsa da araç çalışmaya devam eder.
UYAP'tan inen evraklar, eski kararlar ve müvekkilin gönderdiği belgeler çoğu zaman taranmış görüntüdür: açarsın ama metni seçemez, kopyalayamaz, içinde arama yapamazsın. OCR (optik karakter tanıma) bu görüntüdeki yazıyı okuyup kopyalanabilir metne çevirir; böylece bir paragrafı dilekçene yapıştırmak ya da bir ismi aramak saniyeler sürer.
Metin tanıma cihazında çalışır: belgenin hiçbir sunucuya yüklenmez, bir kopyası tutulmaz. Tek indirilen şey, tarayıcıda çalışan dil modelidir (Türkçe ve İngilizce) ve bu yalnız ilk kullanımda bir kez iner, sonrasında önbellekten gelir — belgen yine tamamen sende kalır. Dava evrakı ve kişisel veri içeren taramalar için bu önemli bir güvencedir.
Türkçe + İngilizce birlikte tanıma varsayılandır; çoğu Türk hukuk belgesi için en iyi sonucu verir. Yalnız Türkçe ya da yalnız İngilizce de seçebilirsin. Çok sayfalı belgelerde istediğin sayfa aralığını verip yalnız onları tarayabilirsin. Tanıma kalitesi taramanın netliğine bağlıdır: düz, yüksek çözünürlüklü ve dik taramalarda sonuç en iyisidir; çok eğri, soluk ya da el yazısı sayfalarda hata payı artar.
Her sayfa için birkaç saniye sürebilir; ilerleme çubuğundan takip edersin. Sonuçta tanınan metni ekrandan kopyalayabilir ya da .txt dosyası olarak indirebilirsin. OCR el yazısını ve bozuk taramaları tam çıkaramayabilir; çıkan metni teslim etmeden önce özellikle isim, tarih ve sayı gibi yerlerde kontrol et.
Taramayı önce tek bir dosyada toplaman gerekiyorsa JPG'yi PDF'ye çevir ya da TIFF'i PDF'ye çevir araçlarını, sayfaları ayıklamak için PDF ayır aracını kullanabilirsin.
Sık sorulan sorular
PDF'i bu sayfaya bırak, dili seç ve “Metni tanı”ya tıkla. Her sayfa taranır; sonucu kopyalar ya da .txt olarak indirirsin.
Hayır. Metin tanıma tarayıcında, cihazında çalışır; belge bize ya da başka bir yere gönderilmez. Yalnız dil modeli ilk kullanımda indirilir.
Türkçe ve İngilizce. İkisini birlikte (varsayılan) ya da tek tek seçebilirsin.
OCR basılı metin için tasarlanmıştır; el yazısı ve çok bozuk taramalarda sonuç zayıf olabilir. Çıkan metni kontrol etmen önerilir.
Dil modeli ilk kullanımda bir kez indirilir; sonrasında aynı tarayıcıda internet olmadan da çalışır.
Evet. “Aranabilir PDF” çıktısını seç: taramanın görünümü aynı kalır, üstüne görünmez bir metin katmanı eklenir; böylece Ctrl+F ile arayabilir, metni seçip kopyalayabilirsin.
İlgili araçlar
Tüm PDF araçları: PDF birleştir · PDF sıkıştır · PDF ayır · Sayfaları düzenle · JPG → PDF · TIFF → PDF · PDF → JPG · İmza ekle · PDF şifresini kaldır · PDF şifrele · Karartma (redaction) · Sayfa numarası ekle · Filigran ekle · PDF → UDF · UDF → PDF