Herramientas gratis
Siete comprobaciones gratis, sin registro
En una frase
La página de herramientas gratis responde dos preguntas en segundos y sin cuenta: si una solicitud de tus registros de acceso que dice ser GPTBot, ClaudeBot, Googlebot u otro rastreador con nombre viene de verdad de ese operador (verificado con los rangos de IP que publica: verificada, suplantada o no verificable, nunca solo dos resultados), y si una máquina puede leer tu robots.txt, tu sitemap y tu llms.txt con el tipo de contenido correcto, o si una caché sirve algo que tu servidor ya no produce.
Escribe un dominio. Sin registro, nada que instalar. Si una máquina puede leer tus archivos, si ese rastreador de tus registros es real, qué permite de verdad tu robots.txt a cada agente de IA, un primer borrador de tu llms.txt a partir de las páginas que ya publicas, cómo te comparas con un competidor, a qué puede anclarse Google en un vídeo de YouTube y si una solicitud de bot firmada viene de verdad del bot que nombra.
¿Tu sitio es uno de ellos? Compruébalo gratis → Las 52 tasas →
¿Puede una máquina leer tus archivos?
Cuatro solicitudes al dominio que indiques: robots.txt, sitemap, llms.txt y la página de inicio, leídos por tipo de contenido y antigüedad de la caché.
¿Es real ese rastreador de tus registros?
Pega líneas sin procesar del registro de acceso. Cada una que nombra un rastreador conocido se comprueba frente a los rangos de direcciones que ese operador publica de verdad.
Esta es la comprobación que casi nadie hace, y da la vuelta a las conclusiones. Un registro lleno de GPTBot con 403 hace pensar que tu hosting está bloqueando a OpenAI, hasta que descubres que todos venían de una sola dirección que usaba siete nombres de rastreador distintos. Lo hemos medido exactamente así en sitios reales. Agrupa por dirección antes de sacar ninguna conclusión.
¿Qué permite tu robots.txt a cada rastreador de IA?
Una sola descarga del archivo y después cada motor de respuestas, índice de búsqueda y rastreador de entrenamiento con nombre se resuelve como lo haría un rastreador: solo su propio grupo, la coincidencia más larga, allow gana en caso de empate.
La regla que la gente entiende mal: un Disallow bajo User-agent: * nunca se aplica a un agente que tiene su propio grupo. Nombra a GPTBot una sola vez en cualquier parte del archivo y toda regla * deja de aplicarse a él. Esto muestra lo que se aplica de verdad, por agente, en la ruta que elijas.
Redacta un llms.txt a partir de lo que ya publicas
Lee tu página de inicio y hasta 25 páginas declaradas con sus propios títulos y descripciones, y escribe un primer borrador con la forma habitual.
Es un borrador a propósito. Un archivo generado es un volcado de enlaces con los títulos como descripciones; el valor del archivo está en la selección. Recórtalo a las páginas por las que alguien preguntaría a un asistente, escribe tú las descripciones y sírvelo como text/plain y comprueba la URL tal cual: la comprobación de arriba te dirá si llegó.
¿Cómo te comparas con un competidor?
Dos páginas de inicio, el mismo escaneo en ambas: cada sección que necesita un motor de respuestas, una al lado de la otra, con los hallazgos que solo tiene uno de los dos.
¿Es real esa solicitud de bot firmada?
Web Bot Auth permite que un bot firme cada solicitud con una clave que publica. Escribe el host del bot o pega las cabeceras de una solicitud firmada, y se muestra cada paso de la comprobación: el directorio de claves, las firmas que lleva, la huella de cada clave, los componentes cubiertos y la ventana de tiempo.
Un user-agent lo puede escribir cualquiera; una firma sobre tu propio nombre de host, no. Una clave solo cuenta si firmó el directorio en el que está, así que una lista de claves copiada o editada no prueba nada. Funciona para cualquier agente que firme, no solo para el nuestro.
¿A qué puede anclarse Google en tu vídeo?
Pega una URL de YouTube: capítulos, tipo de subtítulos, descripción, idioma y temas, cada fila frente a aquello a lo que puede anclarse un resultado de búsqueda. Los canales completos y la conexión con el sitio están en Watch.
Tres resultados, nunca dos
Verificada
La dirección está dentro del rango que publica el operador. La solicitud es lo que dice ser.
Suplantada
El operador publica rangos y esta dirección está fuera de todos. Otro está usando el nombre.
No verificable
El operador no publica ninguna lista, así que la identidad no se puede confirmar ni señalar como falsa. Amazonbot y Meta-ExternalAgent están aquí de forma permanente.
Contar las no verificables como falsas inflaría la tasa; contarlas como genuinas la subestimaría. Por eso la tasa de suplantación solo divide entre verificadas más suplantadas, y la respuesta indica ese denominador en lugar de dejar que lo supongas.
Qué detectan las dos comprobaciones
La comprobación de archivos para máquinas obtiene tu robots.txt, llms.txt y el sitemap como lo haría un rastreador y lee el tipo de contenido y el cuerpo, no solo el estado. El fallo para el que existe: un escudo antibots o una página de verificación que responde HTTP 200 con HTML donde debería haber un archivo de texto. Todos los monitores de disponibilidad lo dan por bueno. Un validador lo interpreta como «sin directivas», lo que equivale a todo permitido: justo lo contrario de lo que dice tu archivo. Vimos cómo se servía así una página de verificación como robots.txt a todos los rastreadores, Googlebot incluido, en caché en el edge durante horas. La comprobación hace una solicitud por archivo e informa de lo que una máquina analizaría realmente.
La comprobación de purga responde una pregunta que tu panel de CDN no responde: ¿la purga que acabas de hacer eliminó algo de verdad? Obtiene la URL antes y después sin saltarse la caché, compara los bytes y lee las cabeceras age y de estado de caché. El fallo para el que existe: una API de purga que devuelve 200 en una capa de caché mientras otra capa (Varnish delante de un origen o una regla de edge que fija un TTL) sigue sirviendo los bytes viejos. Un 200 de un endpoint de purga habla de la llamada a la API, no de la caché. Publicamos un cambio, purgamos, recibimos un 200 y la URL anónima siguió sirviendo el archivo viejo otra hora; esa hora es la razón de este script.
Cuándo ejecutarlas: tras cualquier cambio en un archivo para máquinas, tras cualquier cambio de configuración de la caché o la CDN, y siempre que una corrección para rastreadores «debería» estar publicada. El único hábito que importa: comprueba la URL tal cual desde fuera de tu propia sesión, porque tu navegador con sesión iniciada es el cliente menos representativo de tu sitio.
Llévate los scripts
Las mismas dos comprobaciones, para una terminal. Son las que usamos nosotros.
Ninguna es un producto. Son las comprobaciones que detectaron fallos reales en este proyecto, publicadas porque un artículo que describe una herramienta que no puedes tener es publicidad.
cachecheck.sh
Comprueba si una caché sirve un documento que tu origen ya no produce. Ignora por completo los códigos de estado: un PURGE que devuelve 200 demuestra que algo respondió, no que se eliminara nada. Obtiene la URL tal cual y otra saltándose la caché, las compara y se niega a juzgar si alguna de las dos lecturas es una página de verificación.
Ver o descargar → · curl -sO https://crawlcheck.io/tools/cachecheck.sh
verify.sh
Comprueba si un cambio que publicaste está de verdad en la página que recibe un desconocido. Cuenta tu marcado fuera de las etiquetas style y script, para que un nombre de clase en una hoja de estilos no pase por un elemento de la página; hace tres consultas para que aparezca todo lo condicional; e indica que mide la vista anónima.
Ver o descargar → · curl -sO https://crawlcheck.io/tools/verify.sh
Úsalos, cámbialos, sin necesidad de atribución. No hacen ninguna solicitud de red salvo a la URL que les des.
¿Quieres que la comprobación se haga por ti, dos veces al día?
Estas dos se ejecutan cuando te acuerdas. Las mismas comprobaciones programadas, con un aviso en cuanto cambia un resultado, es lo que se llama monitoreo. Deja una dirección y te avisaremos cuando esté listo: sin cuenta y sin enviarte nada mientras tanto.
Una dirección, un solo propósito. Los scripts de arriba siguen siendo gratis y no necesitan nada de esto.