แปลง PDF เป็นข้อความ

การคัดลอกจากไฟล์ PDF มักได้คำที่ขาดครึ่ง บรรทัดที่ตัดตรงขอบคอลัมน์ และชื่อบริษัทที่โผล่ซ้ำทุกสี่สิบบรรทัด ที่นี่ข้อความจะถูกดึงออกมาและทำความสะอาด การแก้แต่ละอย่างเป็นสวิตช์ที่คุณเปิดเอง และไฟล์ไม่เคยออกจากแท็บนี้

หรือลากมาวางที่นี่

ไฟล์ PDF ที่มีชั้นข้อความ — ไม่ใช่ไฟล์สแกน ขนาดไม่เกิน 60 MB

ไฟล์อยู่บนเครื่องนี้ เปิดอ่านภายในแท็บ และไม่มีการอัปโหลดใด ๆ ทั้งยังไม่ต้องดาวน์โหลดอะไรเพิ่ม — ตัวอ่าน PDF เป็นส่วนหนึ่งของหน้านี้อยู่แล้ว

สิ่งที่ไม่ติดมาด้วย: รูปภาพ ตารางในฐานะตาราง ตัวหนาและตัวเอียง ตารางจะกลายเป็นข้อความทีละบรรทัด ส่วนหน้าแบบสองคอลัมน์จะถูกอ่านจากคอลัมน์ซ้ายก่อน — เพราะข้อความถูกเก็บไว้ในไฟล์ตามลำดับนั้น

เครื่องมือใกล้เคียง: แปลง PDF เป็น Word · รูปภาพเป็นข้อความ · เปรียบเทียบไฟล์ PDF สองไฟล์ · นับจำนวนคำ

วิธีใช้

  1. เลือกไฟล์ PDF ที่มีชั้นข้อความ ไม่ใช่ไฟล์สแกน
  2. เปิดเฉพาะสิ่งที่คุณต้องการ ทั้งการต่อคำที่ถูกตัดด้วยยัติภังค์ การรวมบรรทัดเป็นย่อหน้า และการตัดหัวกระดาษกับเลขหน้าออก
  3. คัดลอกข้อความ หรือดาวน์โหลดเป็นไฟล์ .txt

สิ่งที่ควรรู้

ได้ข้อความมาแล้วก็เพิ่งเสร็จครึ่งเดียว

ไฟล์ PDF ไม่ได้เก็บบรรทัด แต่เก็บชิ้นส่วนข้อความพร้อมพิกัด บรรทัดเดียวมักถูกส่งมาเป็นสิบกว่าชิ้นเพราะฟอนต์เปลี่ยนกลางประโยค และตัวดึงข้อความแบบง่าย ๆ จะคืนมันมาชิ้นละบรรทัด ระบบจึงจับชิ้นส่วนเหล่านั้นมารวมกลับเป็นบรรทัดตามตำแหน่งแนวตั้งก่อน แล้วค่อยทำความสะอาด การจัดกลุ่มแบบเดียวกันนี้ทำงานอยู่ในเครื่องมือเปรียบเทียบไฟล์ PDF สองไฟล์ด้วย ถ้าตรงนั้นทำงานคนละแบบ ไฟล์เดียวกันก็จะให้ผลต่างที่ไม่เหมือนกัน

สามการแก้ไข และไม่มีอันไหนเกิดขึ้นเงียบ ๆ

คำที่ถูกตัดด้วยยัติภังค์จะถูกต่อกลับ แต่เฉพาะเมื่อบรรทัดถัดไปขึ้นต้นด้วยตัวพิมพ์เล็กเท่านั้น ชื่อเฉพาะที่เขียนติดยัติภังค์จึงไม่ถูกเชื่อมเป็นคำเดียว บรรทัดจะถูกรวมเป็นย่อหน้า แต่หัวข้อ ข้อสัญญาที่มีเลขกำกับ และรายการย่อยยังคงอยู่บรรทัดของตัวเอง เพราะการรวมข้อสัญญาเข้าด้วยกันแย่กว่าการเหลือการขึ้นบรรทัดใหม่เกินมา ส่วนหัวกระดาษและเลขหน้าจะถูกตัดออกเพราะมันซ้ำกันทุกหน้า และตัวเลขโดด ๆ จะนับเป็นเลขหน้าก็ต่อเมื่อมันไม่เกินจำนวนหน้าทั้งหมด เลขปี 2026 ในตารางจึงรอดมาได้

ไฟล์สแกนจะได้คำตอบอีกแบบ

ถ้าไฟล์ PDF เป็นไฟล์สแกน ข้างในจะไม่มีข้อความอยู่เลย หน้าเอกสารเป็นรูปภาพล้วน ๆ การคืนกล่องเปล่ากลับไปจะดูเหมือนเครื่องมือเสีย มากกว่าจะเป็นการใช้เครื่องมือผิดตัว หน้านี้จึงบอกว่าเกิดอะไรขึ้นและชี้ไปยังเครื่องมือรู้จำข้อความ ซึ่งอ่านหน้า PDF ได้ด้วย การตรวจนี้ตั้งใจให้หยาบ ๆ คือถ้าทั้งเอกสารมีตัวอักษรไม่ถึงสี่สิบตัว นั่นแปลว่าเป็นคำบรรยายในรูปภาพ ไม่ใช่ชั้นข้อความ

คำถามที่พบบ่อย

เอกสารของฉันถูกอัปโหลดไปที่ไหนหรือไม่

ไม่ ไฟล์ถูกเปิดและอ่านอยู่ในแท็บเบราว์เซอร์นี้ และไม่ต้องดาวน์โหลดอะไรเพิ่มด้วย เพราะตัวอ่าน PDF เป็นส่วนหนึ่งของหน้านี้อยู่แล้ว

ทำไมไฟล์ของฉันได้ข้อความว่างเปล่า

น่าจะเป็นเพราะมันเป็นไฟล์สแกน คือภาพของแต่ละหน้าที่ไม่มีชั้นข้อความ ให้ส่งไปที่ «รูปภาพเป็นข้อความ» แทน เครื่องมือนั้นรู้จำตัวอักษรได้ และรับหน้า PDF ด้วย

ทำไมคอลัมน์ถึงสลับกันมั่ว

เพราะเลย์เอาต์สองคอลัมน์ถูกเก็บไว้ในไฟล์ตามลำดับที่มันถูกวาด และปกติคอลัมน์ซ้ายจะมาก่อนทั้งคอลัมน์ ลำดับที่นี่จึงยึดตามไฟล์แทนที่จะเดาเลย์เอาต์เอาเอง เพราะเดาผิดจะทำให้ข้อความเละยิ่งกว่าที่คอลัมน์ทำเสียอีก

ตารางจะกลายเป็นอะไร

ตารางจะกลายเป็นข้อความเรียงเป็นแถว เซลล์ยังเรียงตามลำดับเดิมแต่เส้นตารางหายไป ถ้าคุณต้องการเส้นตาราง ให้ใช้ «PDF เป็น Excel» ซึ่งคำนวณคอลัมน์จากพิกัด

รับเอกสารใหญ่ได้แค่ไหน

ได้ถึง 60 MB และ 500 หน้าแรก มากกว่านั้นการรอเริ่มไม่คุ้ม และหน้าเว็บจะบอกตรง ๆ แทนที่จะค้าง

เครื่องมือที่เกี่ยวข้อง