เครื่องมือสร้างและทดสอบ robots.txt
สองงานในหน้าเดียว คือประกอบไฟล์ขึ้นจากกฎ และทดสอบไฟล์ที่คุณมีอยู่แล้ว คำตอบไม่ได้บอกแค่ว่า «อนุญาต» หรือ «ปิดกั้น» แต่บอกด้วยว่าบรรทัดไหนเป็นผู้ตัดสิน
เทมเพลต
Google ไม่สนใจ Crawl-delay แต่ Yandex และ Bing ยังอ่านอยู่
สิ่งที่พบ
- ฟรี
- ไฟล์ไม่ออกจากเครื่องของคุณ
- ไม่ต้องสมัคร
- ไม่จำกัดไฟล์
วิธีใช้
- เลือกเทมเพลต หรือพิมพ์รายการพาธที่ต้องการปิด บรรทัดละหนึ่งพาธ
- เพิ่มข้อยกเว้นไว้ใต้ Allow พร้อมใส่ที่อยู่ไซต์แมปของคุณ
- คัดลอกผลลัพธ์หรือดาวน์โหลดไฟล์ แล้วนำไปวางไว้ที่รากของเว็บไซต์
- สลับไปที่แท็บทดสอบ วางไฟล์ของคุณ แล้วตรวจที่อยู่ที่ต้องการกับบอตที่ต้องการ
สิ่งที่ควรรู้
กฎที่ยาวที่สุดชนะ ไม่ใช่กฎที่มาก่อน
ทั้ง Google และ Yandex เลือกกฎจากความยาวของพาธที่ตรงกัน ไม่ใช่จากลำดับในไฟล์ นี่คือเหตุผลที่คู่กฎยอดนิยมอย่าง «Disallow: /wp-admin/» ร่วมกับ «Allow: /wp-admin/admin-ajax.php» ใช้งานได้ พาธที่สองยาวกว่าจึงชนะเฉพาะไฟล์นั้น ส่วนที่เหลือของโฟลเดอร์ยังปิดอยู่ ถ้าเครื่องมือทดสอบอ่านไฟล์จากบนลงล่างก็จะให้คำตอบตรงกันข้าม
กฎที่อยู่เหนือ User-agent บรรทัดแรกไม่เป็นของใครเลย
Disallow ที่เขียนไว้ก่อนบรรทัด User-agent ใด ๆ จะถูกบอตทุกตัวมองข้าม เพราะไฟล์นี้ถูกอ่านเป็นกลุ่ม และกฎที่อยู่นอกกลุ่มก็ไม่มีเจ้าของ มันดูเรียบร้อยดีทุกอย่างแต่ไม่ได้ปิดอะไรเลย จึงเป็นความผิดพลาดที่แพงที่สุดใน robots.txt เครื่องมือทดสอบจะรายงานกรณีนี้แยกต่างหากพร้อมเลขบรรทัด
แหล่งข้อมูล
คำถามที่พบบ่อย
robots.txt เอาหน้าเว็บออกจากผลค้นหาได้ไหม
ไม่ได้ มันหยุดได้แค่การไล่เก็บข้อมูล ที่อยู่ที่ถูกปิดยังโผล่ในผลค้นหาแบบไม่มีคำอธิบายได้ ถ้ามีเว็บอื่นลิงก์มาหา หากต้องการกันหน้าออกจากดัชนี ให้เปิดหน้านั้นให้บอตเข้าถึงได้แล้วใส่เมตาแท็ก noindex ไว้ เพราะบอตต้องโหลดหน้าเว็บก่อนจึงจะเห็นแท็กนั้น
ไฟล์ต้องวางไว้ที่ไหน
ที่รากของโดเมนเท่านั้น คือ https://example.com/robots.txt ไฟล์ที่อยู่ในโฟลเดอร์ย่อยจะไม่ถูกอ่านเลย และซับโดเมนต้องมีไฟล์ของตัวเอง สำหรับ shop.example.com ไฟล์ที่อยู่บน example.com ใช้ไม่ได้
จะปิดกั้นบอต AI ได้อย่างไร
เพิ่มกลุ่มกฎแยกสำหรับแต่ละบอต ทั้ง GPTBot, ClaudeBot, PerplexityBot และ CCBot มีอยู่ในรายการบอตของหน้านี้ พวกมันเคารพ robots.txt แต่การห้ามยึดตามชื่อ กลุ่มที่ใช้เครื่องหมายแทนทุกบอตจะไม่ครอบคลุมพวกมัน ถ้าในไฟล์นั้นพวกมันมีกลุ่มของตัวเองอยู่ด้วย
ควรตั้งค่า Crawl-delay หรือไม่
Google ไม่สนใจค่านี้เลย ส่วน Yandex และ Bing ยังอ่านอยู่ ควรตั้งเฉพาะเมื่อเซิร์ฟเวอร์รับภาระการไล่เก็บข้อมูลไม่ไหวจริง ๆ มิฉะนั้นมันแค่ทำให้หน้าใหม่ของคุณถูกค้นพบช้าลง
เครื่องมือที่เกี่ยวข้อง
- ตัวสร้าง XML Sitemap วางรายการที่อยู่ของคุณลงไป จะมาจากสเปรดชีต จากคอนโซล หรือจากที่ไหนก็ได้ แล้วรับไฟล์ที่เครื่องมื…
- ตัวสร้าง Schema Markup เลือกประเภท กรอกเท่าที่คุณรู้ แล้วคัดลอกแท็ก script ที่พร้อมวางในส่วน head ของหน้าเว็บ สิ่งที่ค…
- ตัวสร้างลิงก์ UTM กรอกช่องต่าง ๆ แล้วลิงก์จะประกอบตัวเอง ถ้าวางลิงก์ที่มีแท็กอยู่แล้ว ช่องต่าง ๆ จะถูกเติมจากลิงก…
- ตรวจสอบ HTTP Header ใส่ที่อยู่เว็บแล้วดูว่าเซิร์ฟเวอร์ตอบอะไรกลับมาบ้าง ทั้งรหัสสถานะ ส่วนหัวทุกตัว และทุกช่วงต่อหา…