¿Qué hace Wind IA SEO?
Wind IA SEO audita un sitio y mide si los motores de IA lo citan. Corre nueve auditores técnicos sobre el dominio, crawlea las páginas con su propio crawler, calcula cuatro scores versionados, observa citaciones en motores generativos, arma un grafo de entidades y emite informes reproducibles. Cada área de esta página dice también qué no hace: los límites escritos son la parte que hace verificable a la otra.
Auditoría técnica
Nueve auditores sobre el dominio, con reglas de id estable y severidad declarada.
Lo que hace
Sobre un dominio corren en paralelo nueve auditores: DNS, TLS, matriz de redirecciones, robots.txt y sitemap, señales de Cloudflare, indexabilidad de la portada, acceso de los crawlers de IA, cabeceras de seguridad y presencia de la entidad de marca en Wikidata. Cada hallazgo sale de un catálogo de 36 reglas con identificador estable —INFRA-DNS-001, SEO-ROBOTS-001, GEO-ROBOTS-001— y severidad P0 a P3, donde P0 es «el sitio no puede rastrearse o indexarse». Las reglas están versionadas, así que un hallazgo de hoy se compara con uno de hace seis meses sabiendo si la vara cambió.
Con qué datos
Respuestas HTTP reales del dominio, resolución DNS, certificado TLS, robots.txt, sitemaps declarados, cabeceras de respuesta y la API pública de Wikidata. Si un auditor falla, se registra el error y la auditoría sigue con los demás: una fuente caída no invalida las otras ocho.
Lo que no hace
- No mide Core Web Vitals de campo por su cuenta: esos datos llegan de PageSpeed y CrUX y requieren su propia credencial de Google.
- No audita nada que esté detrás de un login: sólo ve lo que ve un visitante anónimo.
- No aplica cambios. Auditar es leer; intervenir en el sitio es otro acto, con su conector y su aprobación.
- Todo pedido de red pasa por una barrera anti-SSRF antes de salir, así que un dominio que resuelve a una IP interna se rechaza en vez de auditarse.
GEO y AEO
Qué tan citable es una página por los motores generativos, y si de hecho la citan.
Lo que hace
Dos capas distintas que no se mezclan. La estructural puntúa la citabilidad de cada página en siete dimensiones con peso documentado —extractabilidad, estructura de respuesta, densidad de datos, señales de autoridad, frescura, claridad de entidad y cobertura de schema— y el answerability score, señal por señal, mide qué tan bien funciona la página como respuesta. Todo eso es determinístico sobre el HTML: mismas entradas, mismo resultado, sin IA de por medio. La capa observada es otra cosa: corridas reales contra los motores, guardando el prompt exacto, la respuesta completa, las citas, la posición, el costo y la latencia de cada consulta. Hoy corren cuatro motores —ChatGPT, Perplexity, Gemini y Google AI Overviews— y el quinto del registro, Bing Copilot, está declarado como no disponible.
Con qué datos
HTML crudo de las páginas para la capa estructural, y llamadas facturadas a las APIs de los motores para la observada. El costo estimado del barrido se muestra antes de dispararlo y se registra el costo real de cada consulta. Cada heurística declara además su nivel de evidencia —fuerte, moderado o débil— porque buena parte de la literatura GEO es material de proveedor, no investigación controlada.
Lo que no hace
- No mide Bing Copilot. Microsoft cerró las Bing Search APIs en agosto de 2025 y el reemplazo de Azure no devuelve la respuesta de Copilot sino resultados del índice de Bing pasados por otro modelo. Preferimos declararlo no disponible con el motivo antes que mostrar cero citaciones, que se leería como «nunca te citan» y sería falso.
- No promete posiciones ni citaciones. Observa lo que los motores respondieron y lo registra como dato observado; no controla lo que un proveedor externo decide contestar.
- No publica una tasa de citación con menos de tres corridas: marca muestra insuficiente. Una tasa sobre dos consultas no es una tasa.
- No agrega los motores en un único número sin desglose: el solapamiento de dominios citados entre motores es de alrededor del 11%, así que un promedio escondería justamente lo que importa.
Crawler propio
Descubre el sitio como lo haría un bot, y sobre eso corren los detectores.
Lo que hace
Recorrido en amplitud desde la portada y desde las URLs del sitemap, siguiendo enlaces internos y sin salir del dominio. Respeta robots.txt y el crawl-delay declarado. Deduplica por URL normalizada —sin fragmento, sin parámetros de tracking como utm, fbclid o gclid— y registra de cada página la profundidad en clics desde la home, el estado HTTP, la cadena de redirecciones, las cabeceras y cuánto tardó. Sobre lo crawleado corren los detectores SEO (indexabilidad, contenido, enlaces e imágenes, structured data, head técnico) y se arma el grafo de enlazado interno, que es lo que permite detectar páginas huérfanas, enlaces rotos y distribución de inlinks.
Con qué datos
Sólo lo que el servidor del sitio devuelve. Topes por defecto, deliberadamente conservadores para no castigar al sitio auditado: hasta 40 páginas por corrida, profundidad 3 y cuatro pedidos en paralelo, con tiempo límite por página y para la corrida completa.
Lo que no hace
- No ejecuta JavaScript. Lee el HTML que devuelve el servidor, que es exactamente lo que ve un bot sin render: un sitio que arma todo en el cliente se va a ver vacío, y eso es información, no un error del crawler.
- No sale del dominio ni sigue enlaces externos.
- No cuenta backlinks externos ni estima autoridad de dominio. Eso requiere un índice de enlaces pago —DataForSEO, Ahrefs, Majestic— y no lo estimamos: en el módulo de competidores esos dos ejes quedan explícitamente en nulo con el motivo al lado, en vez de rellenarse con un número inventado.
- No crawlea el sitio entero de un portal grande en una corrida: los topes están para eso y se dicen, no se disimulan mostrando el resultado parcial como si fuera total.
Entidades
Quién es tu marca para una máquina, y si esa identidad resuelve.
Lo que hace
Construye un grafo de entidades del sitio: extrae las entidades declaradas en los bloques JSON-LD, las deduplica por tipo y nombre, intenta resolverlas contra Wikidata y persiste nodos y relaciones. Cada relación guarda su evidencia —de qué URL salió, en qué parte del marcado y con qué fragmento—, y sin evidencia no se crea la relación. Además registra cobertura página por página: si la página se pudo escanear, si declara JSON-LD, cuántas entidades trae y de qué tipos.
Con qué datos
Bloques JSON-LD y HTML de las páginas ya crawleadas, más la API pública de Wikidata. Los bloques con JSON inválido se ignoran pero se cuentan: saber que hay cinco bloques rotos es parte del diagnóstico.
Lo que no hace
- No confunde «no se pudo leer» con «no tiene». Una página que falló queda como no escaneada, con el motivo, y su cobertura de JSON-LD queda en nulo — no en «no».
- No crea nodos sin nombre: una entidad sin identidad sería un nodo fantasma, así que se descarta y se cuenta aparte.
- No inventa el tipo que el sitio declaró. Si el @type es desconocido, se guarda literal en vez de mapearlo a otra cosa.
- No fabrica la entidad de tu marca en Wikidata. Si no existe, lo reporta como hallazgo (GEO-ENTITY-001); crearla es un trabajo editorial que hace una persona.
Objetivos y misiones
Metas atadas a métricas que el sistema sabe medir, con línea de base real.
Lo que hace
Un objetivo apunta a una métrica del catálogo —score SEO, AEO, GEO, Visibility, posición promedio o tasa de citación—, con un valor objetivo, la línea de base real tomada el día en que se creó, una fecha límite opcional y una estrategia escrita que es obligatoria: sin el porqué no hay objetivo, y la base lo exige. El progreso se calcula con el mismo resolvedor que alimenta las alertas del panel, de modo que el tablero y las alertas nunca puedan mostrar dos números distintos de la misma métrica. El informe de misión cuenta después el período completo: de dónde se salió, qué se buscó, qué pasó de verdad, qué costó y qué sigue.
Con qué datos
Exactamente las mismas mediciones que usan las alertas del panel. Ninguna fuente paralela: si mañana se suma una métrica a las alertas, los objetivos la aceptan solos.
Lo que no hace
- Sin dato actual, el objetivo dice «sin datos». No hay porcentaje de avance de relleno.
- Sin línea de base no hay porcentaje de progreso: calcularlo obligaría a inventar el punto de partida.
- No acepta métricas que el sistema no sepa medir. Un objetivo sobre algo inmedible sería una promesa, no una meta.
- Un solo objetivo activo por métrica y sitio, para que no convivan dos metas contradictorias sobre el mismo número.
Informes
Tres vistas del mismo período, reproducibles y con las limitaciones al pie.
Lo que hace
Un informe es una foto reproducible del estado del sitio a una fecha de corte. Hay tres vistas: la ejecutiva (síntesis y próximos pasos), la técnica (metodología, evidencia y anexos) y la de misión, escrita para el cliente, que cuenta el período de punta a punta incluyendo lo que costó. El render es determinista: las mismas entradas producen el mismo texto, sin IA en el medio y sin fechas del momento de generación colándose en el contenido. Todo informe lleva impresa la fecha de corte y las versiones de fórmula y de reglas con las que se calculó, así que dos informes de meses distintos se comparan sabiendo si la vara se movió.
Con qué datos
Lo que ya midieron los otros módulos: scores y su histórico, hallazgos de auditoría, preguntas y cobertura AEO, corridas de citación, priorización y, cuando hay, tráfico. Cada fuente se junta de forma independiente.
Lo que no hace
- No rellena una sección sin datos, ni la omite en silencio: la ausencia queda declarada en las limitaciones del informe, que siempre se imprimen.
- No presenta una estimación como observación. El impacto estimado de un hallazgo se muestra como estimación, con esa palabra.
- No se cae si una fuente falla: la sección queda fuera con su motivo y el resto del informe se genera igual.
¿Qué hace verificables a las seis áreas anteriores?
No es una pantalla del producto: es la condición que hace verificables a las seis áreas de arriba.
Cadena de hashes verificable
Cada decisión y cada acción de consecuencia se sella en una cadena de hashes que calcula la base de datos, no el cliente. La verificación recomputa la cadena y delata cualquier eslabón alterado.
A prueba de evidencia, no a prueba de todo
El producto lo dice con esas palabras: ningún usuario ni bug de la aplicación puede alterar un eslabón sin que la verificación lo detecte, pero una credencial de administración total de la base podría reescribir la tabla entera recomputando hashes. Cerrar eso exige anclar el último hash afuera, y todavía no está hecho.
Si no se pudo verificar, no se afirma que está bien
Cuando la verificación no puede correr, el resultado es «no verificado», nunca «íntegro». La ausencia de evidencia no se presenta como evidencia de integridad.
Aislamiento por cuenta
Multi-tenant con RLS en la base: los datos de un cliente no son visibles para otro, y la escritura de facturación y objetivos queda restringida a los roles de administración de esa cuenta.
¿Con qué pesos, umbrales y costos trabaja el motor?
El motor calcula cuatro puntajes de 0 a 100 con pesos fijos y públicos, aplica 36 reglas técnicas con código estable, cobra cada consulta a un motor de IA a precio declarado y lee cada métrica sobre una ventana temporal fija. Es determinístico: las mismas entradas dan el mismo resultado, sin IA en el medio. Acá están los cinco conjuntos de números completos.
| Puntaje | Cómo se compone | Atención | Crítico |
|---|---|---|---|
| SEO | Penalización por severidad de cada hallazgo, normalizada por página crawleada y repartida en 7 categorías: indexabilidad 30 por ciento, contenido 22 por ciento, enlazado 15 por ciento, datos estructurados 10 por ciento, internacionalización 8 por ciento, rendimiento 8 por ciento, otros 7 por ciento. | 60/100 | 40/100 |
| AEO | Calidad de las respuestas 60 por ciento y cobertura de preguntas 40 por ciento, menos hasta 20 puntos por respuestas duplicadas. | 60/100 | 40/100 |
| GEO | Estructura medida sobre el HTML 70 por ciento —las 7 dimensiones de citabilidad— y citación observada en motores de IA 30 por ciento. | 55/100 | 35/100 |
| Visibility | SEO 35 por ciento, AEO 30 por ciento y GEO 35 por ciento, renormalizado: una disciplina sin datos se excluye del promedio en vez de contar como cero. | 60/100 | 40/100 |
Las dos últimas columnas son puntajes sobre 100: por debajo del primero el tablero avisa, por debajo del segundo marca crítico. Son los valores por defecto y se pueden pisar por sitio. La tasa de citación en IA tiene su propio umbral y se mide en porcentaje: avisa por debajo de 40 por ciento y es crítica por debajo de 20 por ciento. Fórmulas en la versión v1.0; catálogo de reglas técnicas en la 1.0.0.
¿Cómo se reparte el peso dentro del score GEO?
El score GEO no trata a todas las palancas por igual. La extractabilidad se lleva 22 por ciento y la cobertura de schema apenas 5 por ciento, y esa diferencia no es de gusto: si el crawler de un motor no ve texto porque la página se arma en el navegador, no hay marcado que la salve. La densidad de datos pesa 18 por ciento y es, de hecho, la dimensión donde la portada de este mismo sitio sacó su peor nota la primera vez que la medimos con nuestro propio analizador. Estas son las siete dimensiones que mide sobre el HTML servido.
| Dimensión | Peso | Qué observa en el HTML |
|---|---|---|
| Extractabilidad | 22% | Cuánto texto queda visible sin ejecutar JavaScript, el ratio contenido/HTML y si el contenido vive dentro de main o article. |
| Estructura de respuesta | 20% | Si cada sección arranca con una respuesta directa, cuántos H2 y H3 están en formato pregunta, y cuántas listas y tablas hay. |
| Densidad de datos | 18% | Porcentajes, referencias a años y magnitudes con unidad por cada 100 palabras, más la cantidad de tablas de datos. |
| Señales de autoridad | 15% | Etiquetas cite y blockquote, autoría visible y enlaces salientes a fuentes primarias como .gov, .edu, doi.org o arxiv.org. |
| Frescura | 12% | Las fechas dateModified y datePublished declaradas en el JSON-LD de la página. |
| Claridad de entidad | 8% | Si hay una entidad principal identificable en el schema y si enlaza a Wikipedia o Wikidata con sameAs. |
| Cobertura de schema | 5% | Qué tipos de JSON-LD hay y qué tan completos son sus atributos, no la mera presencia del bloque. |
¿Cómo se agrupan las 36 reglas técnicas?
Cada hallazgo de la auditoría sale de una regla con identificador estable —INFRA-DNS-001, SEO-ROBOTS-001, GEO-ROBOTS-001— y ese código viaja con el hallazgo hasta el informe. El prefijo es la familia, así que un hallazgo dice de qué disciplina viene antes de leer el texto.
| Familia | Reglas |
|---|---|
| Infraestructura | 12 |
| SEO técnico | 8 |
| Visibilidad en IA | 6 |
| Cloudflare | 4 |
| Search Console | 4 |
| Despliegue | 2 |
¿Cuánto cuesta consultar cada motor de IA?
Cada consulta a un motor generativo es una llamada paga a una API de terceros, así que el costo estimado se muestra antes de disparar el barrido y ninguna corrida arranca sin un click humano. Preguntar una misma consulta a los cuatro motores operativos cuesta 0,062 USD.
| Motor | Estado | Costo por consulta |
|---|---|---|
| ChatGPT (OpenAI web search) | Operativo | 0,015 USD |
| Perplexity (Sonar) | Operativo | 0,008 USD |
| Gemini (Google Search grounding) | Operativo | 0,035 USD |
| Google AI Overview (vía DataForSEO) | Operativo | 0,004 USD |
| Bing Copilot (no disponible) | Reservado, sin API | — |
Los topes de lectura de la auditoría también están declarados: el robots.txt se lee hasta 512 kB y la portada hasta 3 MB, con un límite de 12.000 ms por request. Lo que quede fuera de esos topes se informa como no leído, nunca como ausente.
¿Cuándo un dato se considera viejo?
Cada métrica declara su ventana temporal y, fuera de ella, el eje queda sin dato en lugar de mostrar un número vencido. La misma regla aplica al veredicto sobre un cambio: los motores necesitan recrawlear, así que antes de dos semanas no hay conclusión que sostener, y un movimiento menor a 5 por ciento se reporta como neutral y no como mejora. El ruido no se firma como resultado.
| Métrica | Ventana | Por qué |
|---|---|---|
| Core Web Vitals de campo | 28 días | CrUX publica el percentil 75 del origen sobre una ventana rodante; no es una medición de laboratorio de una URL. |
| Métricas de competencia | 30 días | El scan corre semanal: la ventana tolera un par de corridas perdidas sin dar por vigente un dato viejo. |
| Veredicto de impacto de un cambio | 14 días | Antes de dos semanas el delta mezcla estacionalidad con datos que el motor todavía no recrawleó, y el veredicto es «muy pronto». La confianza plena pide 14 días de datos a cada lado del cambio. |
| Tasa de citación en motores de IA | 30 días | Las consultas se agrupan en corridas dentro de la ventana; con menos de tres corridas la métrica se marca como muestra insuficiente en vez de presentarse como estable. |
| Clics e impresiones de Search Console | 2 a 3 días | Google publica los datos de Search Console con ese retraso, así que el último tramo de cualquier serie todavía está incompleto y se lee como tal. |
Los umbrales de Core Web Vitals son los oficiales de Google sobre el percentil 75 del origen, no una escala propia: LCP bueno hasta 2500 ms y pobre por encima de 4000 ms; INP bueno hasta 200 ms y pobre por encima de 500 ms; CLS bueno hasta 0,1 y pobre por encima de 0,25. Si un origen no tiene tráfico real suficiente para entrar al dataset público, eso se informa como ausencia de dato y no como un mal resultado.
Todo esto está en los tres planes
No hay áreas apagadas por plan: lo que cambia es la escala — cuántos sitios, cuántas personas y cuánto presupuesto mensual de IA.
Fuentes
Todo lo que esta página afirma sobre el comportamiento de un motor —de búsqueda o generativo— está documentado por quien opera ese motor, o por el estándar que define el formato. Acá está cada documento, con la afirmación nuestra que sostiene. Lo que no aparece en esta lista, por ejemplo un porcentaje de mejora, es porque no tenemos con qué respaldarlo y entonces no lo decimos.
“There are no additional requirements to appear in AI Overviews or AI Mode”
01
AI Features and Your Website · Google Search Central
Que las buenas prácticas de SEO siguen siendo el camino para AI Overviews y AI Mode, sin requisitos adicionales, y que para aparecer como link de apoyo la página tiene que estar indexada y ser elegible para mostrarse con snippet.
https://developers.google.com/search/docs/appearance/ai-features02
General Structured Data Guidelines · Google Search Central
Por qué el FAQ visible y el JSON-LD FAQPage de esta página salen de la misma constante: el marcado tiene que describir contenido que el usuario ve, no contenido que sólo existe en el marcado.
https://developers.google.com/search/docs/appearance/structured-data/sd-policies03
Robots.txt Introduction and Guide · Google Search Central
El auditor de robots.txt y sitemap, que lee las directivas declaradas y comprueba que los sitemaps sean accesibles.
https://developers.google.com/search/docs/crawling-indexing/robots/intro04
Overview of OpenAI Crawlers · OpenAI
El auditor de crawlers de IA. OpenAI declara agentes distintos con propósitos distintos: GPTBot para entrenar sus modelos, OAI-SearchBot para las funciones de búsqueda de ChatGPT y ChatGPT-User para las visitas que inicia una persona. Bloquear los tres por igual no es una sola decisión, son tres.
https://developers.openai.com/api/docs/bots05
Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic
La otra mitad de ese auditor: ClaudeBot, Claude-User y Claude-SearchBot, que el motor comprueba por separado en el robots.txt del dominio.
https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler06
FAQPage · Schema.org
El vocabulario del JSON-LD que emite esta misma página. El tipo, sus propiedades y su definición canónica no los fijamos nosotros.
https://schema.org/FAQPage07
dateModified · Schema.org
La propiedad exacta que lee la dimensión de frescura del motor. La frescura no se estima por lo que parezca reciente: se lee de una propiedad declarada.
https://schema.org/dateModified08
JSON-LD 1.1 · W3C
El formato en que se serializa todo el structured data del sitio, y el que el motor parsea al auditar un dominio ajeno.
https://www.w3.org/TR/json-ld11/09
The /llms.txt file · llms-txt
El estándar que sigue el /llms.txt que sirve este sitio. Es una propuesta emergente, no una norma adoptada por los motores, y se publica sabiendo eso.
https://llmstxt.org/10
GEO: Generative Engine Optimization · arXiv 2311.09735
El origen del término GEO, presentado en noviembre de 2023. Es el trabajo que formaliza los motores generativos como categoría; se enlaza por eso y no como respaldo de ninguna cifra de mejora.
https://arxiv.org/abs/2311.0973511
Wikidata:Introduction · Wikidata
El auditor de entidad: si la marca resuelve como entidad verificable en una base que los motores consultan, o si es sólo un nombre en una página.
https://www.wikidata.org/wiki/Wikidata:Introduction
Las 11 URLs de esta lista se pidieron una por una y devolvieron HTTP 200 el , sin redirección intermedia. Otras cinco candidatas no pasaron el control tal como estaban escritas: una devuelve 404 y cuatro redirigen. De esas cuatro, dos entraron igual por su destino final; las otras dos quedaron afuera, incluida la página del rich result de FAQ, que hoy redirige al aviso de que Google lo retiró. Los cinco descartes están anotados en el código, al lado de la lista.
Actualizado: · si una capacidad cambia, cambian el texto y la fecha; un deploy solo no la mueve.