PDF ke teks

Menyalin dari PDF memberi Anda kata yang terpotong separuh, baris yang putus di tepi kolom, dan nama perusahaan yang berulang setiap empat puluh baris. Di sini teksnya ditarik keluar dan dirapikan: setiap perbaikan adalah sakelar yang Anda nyalakan sendiri, dan berkasnya tidak pernah meninggalkan tab ini.

atau jatuhkan di sini

PDF dengan lapisan teks, bukan hasil pindai. Maksimal 60 MB

File tetap di perangkat ini: dibuka di dalam tab dan tidak ada yang diunggah. Tidak ada juga yang diunduh, karena pembaca PDF-nya sudah menjadi bagian dari halaman ini.

Yang tidak ikut terbawa: gambar, tabel sebagai tabel, huruf tebal dan miring. Tabel berubah menjadi baris-baris teks, dan tata letak dua kolom dibaca mulai dari kolom kiri, sebab begitulah teksnya tersimpan di dalam file.

Di dekat sini: PDF ke Word · Gambar ke Teks · Bandingkan dua berkas PDF · Penghitung kata

Cara pakai

  1. Pilih PDF yang punya lapisan teks, bukan hasil pindaian.
  2. Nyalakan yang Anda butuhkan: menyambung kata terpenggal, menyatukan baris jadi paragraf, membuang kepala halaman dan nomor halaman.
  3. Salin teksnya atau unduh sebagai berkas .txt.

Perlu diketahui

Mendapatkan teksnya baru setengah pekerjaan

PDF tidak menyimpan baris, melainkan potongan teks berikut koordinatnya. Satu baris sering datang sebagai belasan potongan karena fontanya berganti di tengah kalimat, dan penarik teks yang naif mengembalikannya satu potongan per baris. Karena itu potongan-potongan itu lebih dulu dikelompokkan kembali menjadi baris berdasarkan posisi tegaknya, dan baru sesudah itu dibersihkan. Pengelompokan yang sama berjalan di alat yang membandingkan dua PDF: kalau di sana caranya berbeda, berkas yang sama akan menunjukkan perbedaan yang berbeda pula.

Tiga perbaikan, dan tidak satu pun terjadi diam-diam

Kata terpenggal disambung, tetapi hanya kalau baris berikutnya dimulai dengan huruf kecil, supaya nama majemuk tidak ikut terlem jadi satu kata. Baris disatukan menjadi paragraf, tetapi judul, pasal bernomor, dan butir daftar tetap memegang barisnya sendiri, sebab menggabungkan pasal-pasal sebuah kontrak lebih buruk daripada menyisakan beberapa pindah baris. Kepala halaman dan nomor halaman dibuang karena berulang dari halaman ke halaman, dan angka yang berdiri sendiri baru dihitung sebagai nomor halaman kalau nilainya tidak lebih besar daripada jumlah halaman, sehingga angka tahun 2026 di dalam tabel tetap selamat.

Pindaian mendapat jawaban yang berbeda

Kalau PDF-nya hasil pindaian, di dalamnya memang tidak ada teks sama sekali: halamannya berupa gambar. Mengembalikan kotak kosong akan terlihat seperti alat yang rusak, bukan alat yang keliru dipakai, jadi halaman ini menjelaskan apa yang terjadi dan menunjuk ke pengenalan teks, yang juga membaca halaman PDF. Pemeriksaan itu sengaja dibuat kasar: kurang dari empat puluh huruf di seluruh dokumen berarti keterangan di dalam gambar, bukan lapisan teks.

Pertanyaan umum

Apakah dokumen saya diunggah ke suatu tempat?

Tidak. Dokumennya dibuka di dalam tab peramban ini dan dibaca di sana. Tidak ada juga yang perlu diunduh: pembaca PDF-nya sudah menjadi bagian dari halaman ini.

Mengapa teks berkas saya kosong?

Kemungkinan besar itu hasil pindaian: gambar dari setiap halaman tanpa lapisan teks. Jalankan lewat «Gambar ke teks» saja, alat itu mengenali hurufnya dan menerima halaman PDF juga.

Mengapa kolomnya tercampur?

Karena tata letak dua kolom disimpan di berkas persis seperti saat digambar, dan biasanya kolom kiri datang lebih dulu secara utuh. Urutan di sini mengikuti berkasnya alih-alih menebak tata letaknya: tebakan yang salah mengacaukan teks lebih parah daripada kolomnya sendiri.

Apa yang terjadi pada tabel?

Tabel menjadi baris-baris teks: selnya menjaga urutan tetapi kehilangan kisinya. Kalau Anda butuh kisinya, pakai «PDF ke Excel», alat itu menghitung kolomnya dari koordinat.

Seberapa besar dokumen yang bisa diterima?

Sampai 60 MB dan 500 halaman pertama. Lebih dari itu waktu tunggunya tidak lagi sepadan, dan halaman ini mengatakannya alih-alih membeku.

Alat terkait