เครื่องมือสร้างและทดสอบ robots.txt

สองงานในหน้าเดียว คือประกอบไฟล์ขึ้นจากกฎ และทดสอบไฟล์ที่คุณมีอยู่แล้ว คำตอบไม่ได้บอกแค่ว่า «อนุญาต» หรือ «ปิดกั้น» แต่บอกด้วยว่าบรรทัดไหนเป็นผู้ตัดสิน

เทมเพลต

Google ไม่สนใจ Crawl-delay แต่ Yandex และ Bing ยังอ่านอยู่

วิธีใช้

  1. เลือกเทมเพลต หรือพิมพ์รายการพาธที่ต้องการปิด บรรทัดละหนึ่งพาธ
  2. เพิ่มข้อยกเว้นไว้ใต้ Allow พร้อมใส่ที่อยู่ไซต์แมปของคุณ
  3. คัดลอกผลลัพธ์หรือดาวน์โหลดไฟล์ แล้วนำไปวางไว้ที่รากของเว็บไซต์
  4. สลับไปที่แท็บทดสอบ วางไฟล์ของคุณ แล้วตรวจที่อยู่ที่ต้องการกับบอตที่ต้องการ

สิ่งที่ควรรู้

กฎที่ยาวที่สุดชนะ ไม่ใช่กฎที่มาก่อน

ทั้ง Google และ Yandex เลือกกฎจากความยาวของพาธที่ตรงกัน ไม่ใช่จากลำดับในไฟล์ นี่คือเหตุผลที่คู่กฎยอดนิยมอย่าง «Disallow: /wp-admin/» ร่วมกับ «Allow: /wp-admin/admin-ajax.php» ใช้งานได้ พาธที่สองยาวกว่าจึงชนะเฉพาะไฟล์นั้น ส่วนที่เหลือของโฟลเดอร์ยังปิดอยู่ ถ้าเครื่องมือทดสอบอ่านไฟล์จากบนลงล่างก็จะให้คำตอบตรงกันข้าม

กฎที่อยู่เหนือ User-agent บรรทัดแรกไม่เป็นของใครเลย

Disallow ที่เขียนไว้ก่อนบรรทัด User-agent ใด ๆ จะถูกบอตทุกตัวมองข้าม เพราะไฟล์นี้ถูกอ่านเป็นกลุ่ม และกฎที่อยู่นอกกลุ่มก็ไม่มีเจ้าของ มันดูเรียบร้อยดีทุกอย่างแต่ไม่ได้ปิดอะไรเลย จึงเป็นความผิดพลาดที่แพงที่สุดใน robots.txt เครื่องมือทดสอบจะรายงานกรณีนี้แยกต่างหากพร้อมเลขบรรทัด

แหล่งข้อมูล

คำถามที่พบบ่อย

robots.txt เอาหน้าเว็บออกจากผลค้นหาได้ไหม

ไม่ได้ มันหยุดได้แค่การไล่เก็บข้อมูล ที่อยู่ที่ถูกปิดยังโผล่ในผลค้นหาแบบไม่มีคำอธิบายได้ ถ้ามีเว็บอื่นลิงก์มาหา หากต้องการกันหน้าออกจากดัชนี ให้เปิดหน้านั้นให้บอตเข้าถึงได้แล้วใส่เมตาแท็ก noindex ไว้ เพราะบอตต้องโหลดหน้าเว็บก่อนจึงจะเห็นแท็กนั้น

ไฟล์ต้องวางไว้ที่ไหน

ที่รากของโดเมนเท่านั้น คือ https://example.com/robots.txt ไฟล์ที่อยู่ในโฟลเดอร์ย่อยจะไม่ถูกอ่านเลย และซับโดเมนต้องมีไฟล์ของตัวเอง สำหรับ shop.example.com ไฟล์ที่อยู่บน example.com ใช้ไม่ได้

จะปิดกั้นบอต AI ได้อย่างไร

เพิ่มกลุ่มกฎแยกสำหรับแต่ละบอต ทั้ง GPTBot, ClaudeBot, PerplexityBot และ CCBot มีอยู่ในรายการบอตของหน้านี้ พวกมันเคารพ robots.txt แต่การห้ามยึดตามชื่อ กลุ่มที่ใช้เครื่องหมายแทนทุกบอตจะไม่ครอบคลุมพวกมัน ถ้าในไฟล์นั้นพวกมันมีกลุ่มของตัวเองอยู่ด้วย

ควรตั้งค่า Crawl-delay หรือไม่

Google ไม่สนใจค่านี้เลย ส่วน Yandex และ Bing ยังอ่านอยู่ ควรตั้งเฉพาะเมื่อเซิร์ฟเวอร์รับภาระการไล่เก็บข้อมูลไม่ไหวจริง ๆ มิฉะนั้นมันแค่ทำให้หน้าใหม่ของคุณถูกค้นพบช้าลง

เครื่องมือที่เกี่ยวข้อง