Apa itu robots.txt?
robots.txt adalah file pada root domain yang memberi instruksi crawling kepada bot yang mematuhi Robots Exclusion Protocol. File ini dapat berisi kelompok User-agent, directive Disallow/Allow, dan lokasi sitemap.
Apa yang diperiksa Robots.txt Checker?
Tool memeriksa apakah /robots.txt dapat diakses, menghitung kelompok User-agent dan aturan Disallow, membaca directive Sitemap, serta memberi peringatan jika ditemukan pola User-agent: * dengan Disallow: / yang berpotensi memblokir seluruh website dari crawler yang mematuhinya.
Robots.txt bukan alat noindex
Memblokir URL lewat robots.txt berbeda dengan meminta mesin pencari menghapus URL dari indeks. Jika crawler tidak dapat mengakses halaman, crawler juga mungkin tidak dapat membaca meta robots noindex di halaman tersebut. Untuk indexability, periksa robots.txt bersama meta robots, HTTP status, dan canonical.
Periksa setelah migrasi atau staging
Kesalahan yang sering terjadi adalah aturan blokir dari staging terbawa ke website production. Checker ini dapat digunakan sebagai validasi cepat setelah migrasi, perubahan konfigurasi server, atau pemasangan plugin SEO/cache.
Hubungkan dengan sitemap dan site audit
Directive Sitemap di robots.txt membantu crawler menemukan sitemap. Untuk analisis lebih lengkap, gunakan Sitemap Checker dan full-site crawl IDZ SEO agar aturan robots dapat dibandingkan dengan URL yang sebenarnya ditemukan.
Masalah yang sering ditemukan
- Directive Disallow terlalu luas dan memblokir area penting.
- Sitemap tidak diumumkan atau menunjuk endpoint yang tidak valid.
- Robots.txt staging terbawa ke production dan memblokir crawler.
Pemeriksaan lanjutan yang relevan
Jangan membaca hasil tool ini secara terpisah. Untuk memeriksa sinyal yang saling berhubungan, lanjutkan secara natural ke Cek Sitemap Website, Noindex Checker, serta Cek Canonical URL sesuai masalah yang ditemukan pada halaman Anda.
FAQ
Bagaimana cara mengecek robots.txt website?
Masukkan domain dan IDZ SEO akan meminta file robots.txt pada root domain untuk membaca HTTP status, User-agent, Disallow, dan directive Sitemap yang tersedia.
Apakah Disallow berarti halaman noindex?
Tidak. Robots.txt mengatur crawling, sedangkan noindex adalah arahan indexing. Sebuah URL perlu dievaluasi dengan konteks kedua mekanisme tersebut.
Apa arti Disallow: / ?
Pada User-agent yang cocok, Disallow: / dapat memblokir crawling seluruh website. Ini sering disengaja pada staging tetapi berbahaya bila tertinggal di production.