Common Crawl es el corpus web abierto que alimenta la mayoría de los datos de entrenamiento de IA. Comprueba si tus páginas están en él, consulta las URLs reales capturadas y aprende qué corregir.
Los grandes modelos de lenguaje aprenden de la web abierta, y Common Crawl es de donde procede la mayor parte de esa web. Descubre si tus páginas consiguieron entrar.
Comprueba el corpus abierto con el que se entrenan los modelos de IA
Cobertura en los rastreos mensuales recientes
URLs reales capturadas de tu sitio
Una puntuación de presencia sencilla
Common Crawl es un archivo de la web gratuito y de periodicidad mensual, y la mayor fuente pública de datos de entrenamiento de IA. Aparecer en él significa que los rastreadores que alimentan a los modelos de IA pudieron acceder a tus páginas.
Solo usamos tu correo para enviar este informe. Sin spam: puedes darte de baja cuando quieras.
La mayoría de los grandes modelos de lenguaje aprenden de la web abierta, y Common Crawl es la mayor fuente pública de esa web. Si tus páginas no están en Common Crawl, es menos probable que hayan formado parte de los datos con los que se entrenaron los modelos de IA actuales.
Esta herramienta gratuita comprueba si tu dominio aparece en las capturas recientes de Common Crawl, muestra las URLs reales capturadas y te indica qué corregir si tu contenido no aparece.
Buscamos tu dominio en el índice público de Common Crawl.
Comprobamos las capturas mensuales más recientes en busca de tus páginas.
Resumimos presencia, muestras y recomendaciones en un solo informe.
Este comprobador gratuito convierte el índice público de Common Crawl en una respuesta clara sobre tu huella en el entrenamiento de IA.
Si tu dominio aparece en las capturas más recientes de Common Crawl.
URLs de ejemplo reales de tu sitio que Common Crawl capturó.
Cuándo capturó Common Crawl tus páginas por última vez.
Próximos pasos claros si los rastreadores de IA no encuentran tu contenido.
Cómo funciona
Un vistazo rápido a cómo comprobamos tu cobertura en Common Crawl.
Indícanos el dominio que quieres comprobar. No hace falta cuenta.
Consultamos el índice de Common Crawl en sus capturas mensuales más recientes.
Descubre si te capturaron, con URLs de ejemplo reales y qué corregir.
Common Crawl es un archivo gratuito y abierto de la web que se rastrea cada mes. Es la mayor fuente pública de datos de entrenamiento para los grandes modelos de lenguaje, como los que hay detrás de ChatGPT, Claude y Gemini. Si tus páginas están en Common Crawl, estaban disponibles para los rastreadores que alimentan el entrenamiento de la IA.
Consultamos el índice de Common Crawl para tu dominio en sus capturas mensuales más recientes. Te indicamos si tu sitio se capturó, cuántas páginas se indexaron, URLs de ejemplo reales y cuándo se produjo la última captura.
Common Crawl es una muestra de la web y va unas semanas por detrás del tiempo real, así que una página que falte en una captura no demuestra que sea invisible para la IA. La presencia constante en varios rastreos es la señal más sólida. Para descartar problemas de acceso, ejecuta también el Comprobador de robots.txt para IA y el Comprobador de rastreabilidad GEO.
Respuestas a las preguntas más habituales sobre Common Crawl y los datos de entrenamiento de IA.
LLM Pulse es la plataforma integral de búsqueda con IA y GEO. Usa estas herramientas gratuitas para auditar cómo ven los motores de IA tu marca y luego monitoriza todo en un solo lugar.
Descubre con qué frecuencia los motores de IA mencionan tu marca en ChatGPT, Perplexity y Gemini.
Comprueba si las respuestas de IA mencionan tu marca en los prompts que importan.
Mide hasta qué punto los motores de IA descubren tu marca.
Puntúa tu dominio según los archivos, formatos e interfaces que buscan los agentes de IA.
Comprueba si los motores de IA pueden rastrear y renderizar tus páginas.
Comprueba si los rastreadores de IA tienen permiso para leer tu sitio.
Genera un archivo llms.txt para que los rastreadores de IA entiendan tu sitio.
Comprueba si tu sitio aparece en Common Crawl, el corpus abierto con el que se entrena la mayoría de los modelos de IA.
Comprueba si la estructura de tu sitio ayuda a los motores de IA a entenderte.
Audita tus datos estructurados para que la IA y los motores de búsqueda entiendan tus páginas.
Evalúa el grado de optimización de una página para los motores de respuesta de IA.
Comprueba si tu contenido está listo para citarse en las respuestas de IA.
Valida tu feed de productos para ChatGPT Shopping.
Elimina caracteres ocultos, espaciados extraños y formatos sobrantes del texto pegado.
Detecta caracteres de marca de agua invisibles en el texto, decodifica las cargas ocultas y elimínalos del texto.
Saber que estás en los datos de entrenamiento es el primer paso. LLM Pulse monitoriza cómo ChatGPT, Perplexity y Gemini mencionan y citan realmente tu marca, todo en un mismo lugar.