OCR ไฟล์ PDF

สัญญาที่สแกนมา หน้ากระดาษที่ถ่ายรูปไว้ แฟกซ์เก่าที่บันทึกเป็น PDF ทั้งหมดนี้ดูเหมือนเอกสารแต่ทำตัวเหมือนรูปภาพ ค้นหาไม่ได้ คัดลอกสักบรรทัดก็ไม่ได้ และโปรแกรมอ่านหน้าจอก็ไม่มีอะไรให้อ่านออกเสียง หน้านี้จะรู้จำคำต่าง ๆ แล้ววางกลับไปยังตำแหน่งเดิมบนหน้ากระดาษแบบมองไม่เห็น ไฟล์สแกนยังหน้าตาเหมือนเดิม แต่ทุกอย่างที่เหลือเริ่มทำงาน

การอ่านนี้คือการเดา ไม่ใช่การอ่านจริง หน้ากระดาษที่พิมพ์สะอาดจะออกมาเกือบสมบูรณ์ แต่ภาพถ่ายใบเสร็จยับ ๆ จะไม่เป็นเช่นนั้น ระบบไม่แก้อะไรให้อัตโนมัติ เพราะการแก้ตัวเลขให้ดูสมเหตุสมผลคือความผิดพลาดที่คุณจะไม่มีวันจับได้

ไฟล์สแกนไม่ถูกอัปโหลด ตัวประมวลผลและโมเดลภาษาจะถูกดาวน์โหลดมาไว้ในเบราว์เซอร์ของคุณและทำงานที่นั่น สิ่งที่ได้คือไฟล์สแกนเดิมของคุณที่มีชั้นข้อความมองไม่เห็นซ้อนอยู่ — ภาพยังเหมือนเดิม แต่การค้นหา การคัดลอก และโปรแกรมอ่านหน้าจอใช้งานได้

เครื่องมือใกล้เคียง: รูปภาพเป็นข้อความ · แปลง PDF เป็นข้อความ · แปลง PDF เป็น Word · บีบอัดไฟล์ PDF

วิธีใช้

  1. เลือกไฟล์ PDF ที่สแกนมา
  2. เลือกภาษาของเอกสาร ความแม่นของการรู้จำขึ้นกับข้อนี้มากกว่าสิ่งอื่นใด
  3. กดปุ่ม รอสักครู่ แล้วดาวน์โหลดไฟล์ PDF ที่ค้นหาได้หรือไฟล์ข้อความล้วน

สิ่งที่ควรรู้

PDF ที่ค้นหาได้คืออะไรกันแน่

มันคือไฟล์สแกนของคุณที่มีชั้นที่สองเพิ่มเข้ามา นั่นคือคำที่รู้จำได้ วางทับตรงตำแหน่งของคำที่พิมพ์ไว้พอดี และเขียนด้วยหมึกที่มองไม่เห็น หน้ากระดาษยังดูเหมือนเดิมทุกประการ ทั้งเนื้อกระดาษ ตราประทับ และลายมือที่เขียนไว้ริมขอบ แต่กด Ctrl+F แล้วหาชื่อเจอ คัดลอกข้อความได้ และโปรแกรมอ่านหน้าจออ่านออกเสียงได้ นี่คือเหตุผลที่เราเก็บภาพเดิมไว้แทนที่จะแทนด้วยข้อความสะอาด ๆ ไฟล์สแกนมักเป็นเอกสารที่ใช้อ้างอิงเป็นหลักฐาน การจัดเรียงใหม่จะทำให้มันกลายเป็นของอีกอย่างหนึ่ง

การรู้จำคือการเดา ไม่ใช่การอ่าน

หน้ากระดาษที่พิมพ์มาชัดเจนจะออกมาเกือบสมบูรณ์แบบ แต่ภาพถ่ายใบเสร็จที่ยับยู่ยี่จะไม่เป็นแบบนั้น และไม่มีเอนจินตัวไหนเปลี่ยนเรื่องนี้ได้ ระบบจึงแสดงค่าความมั่นใจเฉลี่ยหลังประมวลผลเสร็จ และไม่แก้ไขอะไรให้อัตโนมัติ เพราะการแก้ตัวเลขให้ดูสมเหตุสมผลคือความผิดพลาดชนิดที่ไม่มีใครจับได้เลย อ่านข้อความให้ครบก่อนนำไปใช้จริง โดยเฉพาะตัวเลข

คำถามที่พบบ่อย

ไฟล์สแกนของฉันถูกอัปโหลดไหม

ไม่ เอนจินและโมเดลภาษาถูกดาวน์โหลดเข้ามาในเบราว์เซอร์ของคุณแล้วทำงานอยู่ตรงนั้น ไฟล์ยังอยู่บนเครื่องคุณ

ต้องดาวน์โหลดขนาดเท่าไร

ราวสองถึงสามเมกะไบต์ คือตัวเอนจินบวกกับโมเดลภาษาหนึ่งภาษา หน้าเว็บจะบอกไว้ก่อนที่คุณจะกดปุ่ม และหลังจากรันครั้งแรกทุกอย่างจะทำงานได้แบบออฟไลน์

ไฟล์ PDF ของฉันมีข้อความอยู่แล้ว ควรรันไหม

ไม่ควร และหน้าเว็บจะบอกเองเมื่อมันตรวจพบ เพราะการรู้จำจะเอาการเดามาแทนข้อความที่ดีอยู่แล้ว ให้ใช้ «PDF เป็นข้อความ» แทน

รับได้กี่หน้า

ได้ถึงห้าสิบหน้า มากกว่านั้นเบราว์เซอร์จะใช้เวลาหลายสิบนาที และหน้าเว็บจะบอกว่าทำไปได้กี่หน้า

เครื่องมือที่เกี่ยวข้อง