OCR PDF

Kontrak hasil pindaian, halaman yang difoto, faks lama yang disimpan sebagai PDF: semuanya tampak seperti dokumen tetapi berperilaku seperti gambar. Isinya tidak bisa dicari, satu baris pun tidak bisa disalin, dan pembaca layar tidak punya apa pun untuk dibacakan. Halaman ini mengenali kata-katanya dan meletakkannya kembali di posisinya pada halaman, secara tak terlihat. Pindaiannya tampak sama; selebihnya mulai bekerja.

Pengenalan itu menebak, bukan membaca: halaman cetak yang bersih keluar nyaris sempurna, foto struk yang kusut tidak. Tidak ada yang dikoreksi otomatis; angka yang diperbaiki agar terlihat masuk akal justru kesalahan yang tak akan pernah Anda tangkap.

Hasil pindai tidak diunggah: mesin dan model bahasanya diunduh ke browser Anda dan bekerja di sana. Yang keluar adalah pindaian Anda sendiri dengan lapisan teks tak terlihat di atasnya: gambarnya sama, tetapi pencarian, penyalinan, dan pembaca layar jadi berfungsi.

Di dekat sini: Gambar ke Teks · PDF ke teks · PDF ke Word · Kompres PDF

Cara pakai

  1. Pilih PDF hasil pindaian.
  2. Pilih bahasa dokumennya: keberhasilan pengenalan bergantung pada hal ini lebih daripada apa pun.
  3. Tekan tombolnya, tunggu, lalu unduh PDF yang bisa dicari atau teks polosnya.

Perlu diketahui

Apa sebenarnya PDF yang bisa dicari itu

Ia adalah pindaian Anda dengan lapisan kedua: kata-kata yang dikenali, diletakkan persis di atas kata cetaknya dan digambar dengan tinta tak terlihat. Halamannya tampak identik: kertas yang sama, cap yang sama, tulisan tangan yang sama di tepi. Namun Ctrl+F bisa menemukan sebuah nama di dalamnya, sebuah frasa bisa disalin, dan pembaca layar bisa membacakannya. Karena itulah gambarnya dipertahankan alih-alih diganti teks bersih: pindaian sering kali adalah dokumen bukti, dan menata ulangnya akan mengubahnya menjadi hal lain.

Pengenalan adalah tebakan, bukan pembacaan

Halaman cetak yang bersih keluar hampir sempurna. Foto struk yang kusut tidak, dan tidak ada mesin yang mengubah kenyataan itu. Karena itu tingkat keyakinan rata-rata ditampilkan setelah proses selesai, dan tidak ada yang dikoreksi otomatis: koreksi yang terlihat masuk akal pada sebuah angka adalah jenis kesalahan yang tidak pernah tertangkap siapa pun. Bacalah teksnya sebelum Anda mengandalkannya, terutama angka-angkanya.

Pertanyaan umum

Apakah pindaian saya diunggah?

Tidak. Mesin dan model bahasanya diunduh ke peramban Anda dan berjalan di sana; berkasnya tetap di perangkat.

Berapa besar yang harus diunduh?

Sekitar dua sampai tiga megabita: mesinnya ditambah satu model bahasa. Angkanya tertulis di halaman sebelum Anda menekan tombol, dan setelah proses pertama semuanya bekerja tanpa koneksi.

PDF saya sudah punya teks, perlukah dijalankan?

Tidak, dan halaman ini mengatakannya begitu ia menyadarinya: pengenalan justru akan mengganti teks yang baik dengan tebakan. Pakai «PDF ke teks» saja.

Berapa halaman yang bisa ditangani?

Sampai lima puluh. Lebih dari itu peramban akan menghabiskan puluhan menit, dan halaman ini memberi tahu berapa banyak yang selesai.

Alat terkait