Wind IA SEO

Transparencia: qué medimos y qué nos dio a nosotros

Wind IA SEO mide la citabilidad de una página en siete dimensiones con peso fijo y su answerability en diez señales. Medimos este mismo sitio: la portada sacó 53/100 en citabilidad y 76/100 en answerability, y después de corregir dio 86 y 90. Acá están los pesos, las dos mediciones, la dimensión que sigue reprobada y las tres cosas que decidimos no medir.

Medición del 3 de agosto de 2026, sobre el HTML público de cada página · Actualizado: 3 de agosto de 2026 · Publicado por Wind IA SEO

¿Qué mide el score de citabilidad y cuánto pesa cada dimensión?

El score de citabilidad mide siete dimensiones del HTML servido, sin ejecutar JavaScript, y las pondera con peso fijo: extractabilidad 22%, estructura de respuesta 20%, densidad de datos 18%, señales de autoridad 15%, frescura 12%, claridad de entidad 8% y cobertura de schema 5%. Los pesos suman 100% y viven en una constante del motor. El cálculo es determinístico: las mismas entradas dan el mismo resultado, sin IA en el medio.

Las 7 dimensiones del score de citabilidad, con el peso exacto que tienen en el motor. Los pesos suman 1.
DimensiónPesoQué observaPor qué pesa eso
Extractabilidad22%Palabras visibles en el HTML que devuelve el servidor, uso de <main> o <article>, proporción entre texto y marcado, párrafos que arrancan con «esto», «eso» o «además», y texto escondido en acordeones o display:none.Es el portón. Los crawlers de ChatGPT, Claude y Perplexity descargan el JavaScript pero no lo ejecutan: si el contenido se arma en el cliente, para cinco de seis motores la página está vacía. Por eso hay una regla que no es un peso: con extractabilidad por debajo de 50/100, el total queda topeado en 40/100.
Estructura de respuesta20%Proporción de subtítulos en formato pregunta, largo del primer párrafo de cada sección (entre 25 y 90 palabras), listas, tablas y una definición explícita del tipo «X es Y» al principio.Reestructurar el mismo contenido subió la citación 17,3% en la prueba que el motor toma como evidencia moderada, consistente en seis motores. El múltiplo que suele citarse para las tablas viene de un proveedor y sin control publicado: el motor lo usa, pero lo marca como evidencia débil.
Densidad de datos18%Porcentajes, años, magnitudes con unidad y tablas, contados como hechos por cada 100 palabras. La escala satura en 3 hechos por cada 100 palabras.Agregar estadísticas (+25,9%) y citas textuales (+27,8%) están entre los métodos más fuertes que midió el paper de Princeton; el motor lo registra como evidencia fuerte. Es la dimensión de contenido que más pesa y la que peor sacamos.
Señales de autoridad15%Links salientes a fuentes primarias (.gov, .gob.ar, .edu, doi.org, arXiv, PubMed, Wikipedia, Wikidata), etiquetas <cite> y <blockquote>, autor identificado y sameAs en el schema.Citar fuentes primarias midió +24,9% en el mismo paper: evidencia fuerte. El efecto de la autoría nombrada aparece en fuentes convergentes y no en un experimento controlado, así que se declara como evidencia moderada.
Frescura12%dateModified y datePublished del JSON-LD, article:modified_time, <time datetime> y una fecha de actualización visible en el texto. Sin ninguna fecha detectable, la dimensión queda fija en 20/100.Cerca de la mitad de las citas de los motores con recuperación en vivo son de contenido de menos de 13 semanas, y una página pierde alrededor de la mitad de su potencial de citación en 12 meses. Si la fecha del schema no coincide con la visible, el motor lo marca: la frescura cosmética se descuenta.
Claridad de entidad8%Nombre de la entidad principal en el schema, coincidencia entre <title> y <h1>, sameAs hacia Wikipedia o Wikidata, y presencia de la marca esperada.Desambiguar de quién o de qué habla la página es una señal de confianza, sobre todo para los motores que se apoyan en autoridad tópica venida del entrenamiento. Evidencia convergente, no experimento controlado.
Cobertura de schema5%Bloques JSON-LD válidos, presencia de tipos de alto valor (Organization, Article, FAQPage, Person, Product) y qué tan poblados están sus atributos.Peso bajo a propósito: dos estudios controlados dieron resultado nulo o negativo para el schema genérico, y uno midió −4,6% en AI Overviews. El structured data ayuda a extraer, no a que te citen — declararlo con más peso sería vender humo con formato técnico.

La base de evidencia está declarada, no sugerida. Los efectos más fuertes que usa el motor salen de un paper con revisión: GEO: Generative Engine Optimization (arXiv 2311.09735, KDD 2024), que midió qué le pasa a la visibilidad de una página cuando se le agregan estadísticas, citas textuales y fuentes enlazadas. Los múltiplos que circulan en la industria sin control publicado también se usan, pero el motor los marca como evidencia débil: buena parte de la literatura sobre GEO es material de proveedor, no investigación. La claridad de entidad, por ejemplo, se resuelve contra Wikidata, que es una base pública y verificable por cualquiera.

Hay una regla que no es un peso. Si la extractabilidad queda por debajo de 50/100 —el robot ve una página vacía porque el contenido se arma con JavaScript— el total se topea en 40/100 por bueno que esté el resto. Vender ajustes finos de contenido sobre un sitio que el crawler todavía no puede leer sería cobrar por algo que no va a servir.

¿Qué mide el score de answerability y qué hace con lo que no puede evaluar?

El score de answerability mide diez señales de qué tan bien funciona la página como respuesta: respuesta directa al inicio 18%, coherencia entre pregunta y respuesta 12%, cobertura de subpreguntas 12%, definiciones concisas 10%, estructura semántica 10%, evidencia 10%, autoría 8%, entidad inequívoca 8%, calidad de FAQ 6% y legibilidad 6%. Una señal que no se puede evaluar se excluye del promedio y baja la confianza; no puntúa cero.

Las 10 señales del score de answerability, con su peso. Los pesos suman 1 y se renormalizan cuando alguna señal no se puede evaluar.
SeñalPesoQué evalúa
Respuesta directa al inicio18%El primer párrafo sustantivo: que no arranque con un preámbulo, que responda en la primera oración y que mida entre 40 y 75 palabras, que es el largo del pasaje que los motores citan.
Coherencia pregunta–heading–respuesta12%Entre los subtítulos que sí son preguntas, cuántos tienen debajo una respuesta directa que reutilice al menos el 20% de las palabras significativas de la pregunta.
Cobertura de subpreguntas12%Qué proporción de las preguntas del tema tiene una sección propia que las responde. Sin preguntas de referencia cargadas, se aproxima por la cantidad de secciones con respuesta.
Definiciones concisas10%Si hay una definición del tipo «X es Y» cerca del inicio y si es lo bastante corta para extraerla: entre 8 y 40 palabras.
Estructura semántica (headings/listas/tablas)10%Cantidad de subtítulos en relación al volumen de texto, listas, tablas y uso de <main>, <article> o <section>.
Evidencia (datos, fechas, fuentes)10%Datos con contexto (números con unidad, porcentajes, fechas), cantidad de dominios distintos enlazados como fuente y ejemplos explícitos.
Autoría y actualización8%Autor identificado por byline, rel=author o schema Person, y una fecha de actualización detectable.
Entidad inequívoca8%Entidad principal declarada en el schema y coincidencia entre el <title> y el <h1> de la página.
FAQ útil y no redundante6%Sólo si la página es una FAQ: que las preguntas no se repitan y que la respuesta debajo de cada una funcione como respuesta. Si la página no es una FAQ, la señal queda sin datos — no la convertimos en FAQ artificial.
Legibilidad y densidad informativa6%Palabras por oración (el óptimo llega hasta 25) y cantidad de párrafos de más de 150 palabras.

La diferencia entre «señal ausente» y «no evaluable» es la parte que más nos importa de este score. Una página que no es una FAQ no recibe un cero en calidad de FAQ: esa señal queda afuera del promedio, el resto se renormaliza y la confianza del score baja de 100% a 94%, que es exactamente el peso que se dejó de evaluar. Un cero diría que la página tiene una FAQ mala, y sería falso.

¿Qué puntajes sacó este mismo sitio cuando lo medimos?

La portada de windiaseo.com.ar sacó 53/100 de citabilidad y 76/100 de answerability en la primera medición, y 86 y 90 en la segunda, después de corregir. Precios pasó de 49 y 72 a 78 y 87; funciones, de 44 y 72 a 73 y 95. Las dos columnas se publican juntas: la distancia entre ellas es el contenido de esta página. El motor corrió con la misma fórmula con la que audita a un cliente.

Las dos mediciones del sitio, corridas el 3 de agosto de 2026 sobre el HTML público de cada página. Ambos scores van de 0 a 100.
PáginaCitabilidad (GEO)antes → despuésAnswerability (AEO)antes → después
Portada /53 → 86/10076 → 90/100
Precios /precios49 → 78/10072 → 87/100
Funciones /funciones44 → 73/10072 → 95/100
Transparencia /transparencia79/10091/100

Las cinco dimensiones que quedaron más abajo, y qué se hizo con ellas

Los puntajes bajos no fueron un accidente de implementación: fueron la consecuencia medible de una decisión editorial. El sitio comercial se escribió con la regla de no publicar ninguna cifra que no pudiéramos verificar, y el motor cuenta hechos, no intenciones. La corrección fue publicar los datos reales que ya existían en el código, no aflojar la regla. Sólo una de las cinco llegó a 100; tres quedaron entre 68 y 77, y una sigue reprobada. Están así en la tabla.

Las cinco dimensiones con peor puntaje en la primera medición, medidas sobre la portada, con lo que dieron después de corregir. Ordenadas por impacto original (peso alto y puntaje bajo primero).
Dimensión o señalAntes → despuésPesoQué pasóQué se hizo
Densidad de datosCitabilidad (GEO)368/10018%El motor cuenta porcentajes, años, magnitudes con unidad y tablas. El sitio comercial casi no tenía ninguno, y no por descuido: se escribió con la regla de no publicar ninguna cifra que no pudiéramos verificar, y no teníamos mediciones propias para mostrar. Inventar un «+40% de tráfico» habría subido esta dimensión en una tarde. Es la dimensión que más pesa y la que peor sacamos.Se publicaron los datos que ya existían en el código y estaban escondidos: los pesos de cada score, los umbrales de alerta, el costo por consulta de cada motor, los límites de cada plan y las ventanas de medición. Ninguna cifra nueva se escribió a mano — se derivan por import de su fuente, así que no pueden divergir. Sigue sin haber un solo dato de resultados de clientes, porque no los hay.
Evidencia (datos, fechas, fuentes)Answerability (AEO)377/10010%La señal cuenta datos con contexto y dominios distintos enlazados como fuente. No enlazábamos ninguna fuente externa: todo lo que afirmábamos salía de nuestro propio código, así que no había a quién citar. Que la afirmación sea verificable puertas adentro no la hace verificable para un motor.Se agregó una sección de fuentes con documentación primaria: Google sobre Google, OpenAI y Anthropic sobre sus propios crawlers, schema.org y el W3C sobre los formatos. Cada URL se verificó a mano y se publica el destino final, sin redirección. Cinco candidatas quedaron afuera por dar 404 o por redirigir; una de ellas era la página del rich result de FAQ, que Google retiró.
Señales de autoridadCitabilidad (GEO)2568/10015%Cuenta links a fuentes primarias, etiquetas <cite> y <blockquote>, autor identificado y sameAs en el schema. El sitio hablaba de sí mismo sin apoyarse en nada externo, y el schema de la marca sigue sin sameAs porque no tenemos perfiles verificados que declarar: un sameAs equivocado ata la marca a una cuenta ajena.Subió con las fuentes citadas, pero no llega a 100 y no va a llegar por ahora: le faltan los veinte puntos del sameAs, que sigue vacío por el mismo motivo de siempre. Tampoco se rellenó la lista con enlaces de adorno para simular autoridad — sería justo el truco que este producto marca como hallazgo.
Coherencia pregunta–heading–respuestaAnswerability (AEO)2236/10012%Mide, entre los subtítulos que sí son preguntas, cuántos tienen debajo una respuesta directa que reutilice las palabras de la pregunta. Poco más de uno de cada cinco pasaba: los títulos preguntaban y el párrafo de abajo arrancaba explicando el contexto en vez de responder.Es la que peor quedó y la única que sigue reprobada. Se corrigieron los encabezados de las páginas de precios y funciones, pero en la portada la mayoría de las respuestas del FAQ todavía abre con «Sí» o «No» antes de responder, que es exactamente lo que la señal penaliza. Reescribirlas es trabajo de redacción pendiente, no una limitación del motor. Queda anotado acá hasta que se haga.
FrescuraCitabilidad (GEO)20100/10012%20/100 es el piso que el motor asigna cuando no encuentra ninguna fecha. Las páginas comerciales no declaraban dateModified ni mostraban fecha de actualización, y poner una fecha de hoy en una página que no cambió sería justamente la frescura cosmética que el motor descuenta.Las cuatro páginas declaran ahora dateModified en el JSON-LD y muestran la misma fecha en pantalla, desde una única constante que se edita a mano junto con el contenido. No se calcula con la fecha del deploy a propósito: si el texto no cambió, la fecha no se mueve.

La tensión es real y no la disimulamos: un sitio honesto y genérico puntúa bajo en un motor que premia el dato concreto. La salida no es aflojar la regla, es publicar los datos reales que ya teníamos —los pesos, los umbrales, los puntajes propios— en lugar de inventar los que no. Esta página es el primer ejemplo, y se mide con la misma vara que el resto.

Cuando volvamos a medir, estos números cambian acá y la fecha de arriba cambia con ellos. Mientras diga 3 de agosto de 2026, son los de esa corrida.

¿Qué decidimos no medir, y por qué?

Hay tres cosas que decidimos no medir: autoridad de dominio, backlinks y Core Web Vitals de campo. Las dos primeras necesitan un índice de enlaces pago —el grafo de enlaces de la web no es observable gratis— y estimarlas con un proxy sería inventar un número con cara de dato. Los Core Web Vitals de campo son de CrUX, el reporte de experiencia de Chrome, y necesitan credencial de Google.

Política del producto, no una limitación temporaria de esta página: es lo que el panel ya muestra puertas adentro.
QuéPor qué noQué mostramos en su lugar
Autoridad de dominioRequiere un índice de enlaces pago —DataForSEO, Ahrefs, Majestic—. El grafo de enlaces de la web no es observable gratis y no existe un proxy honesto que se parezca a un Domain Rating: ni el tamaño del sitio ni la antigüedad del dominio lo aproximan.«Sin datos», con el motivo al lado, tanto para tu sitio como para el competidor. El día que se conecte un índice, el eje se llena con dato comprado y etiquetado como comercial, con techo de confianza 0,80.
BacklinksMismo motivo: sin índice de enlaces pago no hay forma de contarlos. Estimarlos con una heurística y mostrarlos como un número redondo sería inventar un dato con cara de medición.«Sin datos». Nunca un cero: un cero se lee como «no tenés ninguno», que es una afirmación que no podemos sostener.
Core Web Vitals de campoLos mide Chrome en los visitantes reales y los publica CrUX, agregados sobre los últimos 28 días. Hace falta una credencial de Google, y un origen con poco tráfico real directamente no entra en el dataset.Cuando hay datos, se comparan contra los umbrales oficiales de Google (LCP hasta 2500 ms, INP hasta 200 ms, CLS hasta 0,1). Cuando no, la respuesta es «CrUX no tiene datos de campo para este origen», que es un resultado válido y no un error del producto.

Los umbrales de Core Web Vitals y el detalle de qué publica el reporte de experiencia de Chrome son públicos: están en la documentación de Web Vitals y en la de CrUX. No los reescribimos: los usamos tal como están y decimos de dónde salen.

La regla de la casa detrás de las tres filas: una medición ausente se guarda como fila ausente, nunca como 0. «Sin datos» significa exactamente eso, y no que se haya medido un cero. Es la diferencia entre un tablero que informa y uno que decora.

¿Qué significa cada nivel de confianza?

La confianza va de 0 a 1 y tiene cuatro bandas con significado fijo: exploratoria, moderada, alta y muy alta. Encima de eso, el origen del dato pone un techo que la muestra no puede levantar: una inferencia con mil casos sigue siendo una inferencia. Por eso todo número que se guarda o se muestra pasa antes por ese tope.

Las cuatro bandas de confianza. Los intervalos son semiabiertos: el borde exacto pertenece siempre a la banda de arriba, así que 0,60 es «alta» y no «moderada».
BandaRangoQué se puede hacer con un dato así
Exploratoria0,000,40Indicio: sirve para decidir dónde mirar, NO para justificar un cambio.
Moderada0,400,60Alcanza para priorizar, no para afirmar. Conviene sumar evidencia antes de actuar.
Alta0,600,85Suficiente para accionar, declarando siempre el origen del dato.
Muy alta0,851,00Medición directa con muestra suficiente: se puede reportar como hecho.
Techo de confianza por origen del dato. No es el valor de la confianza: es el máximo que ese origen puede alcanzar por mucha muestra que junte.
OrigenTechoQué es
Observado1,00Lo medimos nosotros, directo del mundo público: HTML, DNS, TLS, robots, cabeceras.
Declarado0,95Viene de una API oficial autenticada, como Search Console o Analytics. Es un hecho, pero de un tercero: no vimos la medición, confiamos en ella.
Comercial0,80Proveedor pago. Metodología cerrada y no auditable por nosotros.
Inferido0,60Derivado por heurística o por IA. Presentarlo como hecho sería mentir.
Experimental0,40Experimento en curso: por definición todavía no concluye.

«Una inferencia NUNCA puede presentarse con la confianza de un hecho medido.»

Comentario del módulo de confianza, en el código de Wind IA SEO

Del mismo módulo salen otras dos reglas que preferimos decir antes de que las descubra un cliente. La confianza combinada de varias fuentes nunca supera a la más alta de ellas: tres heurísticas flojas que coinciden siguen siendo flojas, no se vuelven certeza por sumarse. Y la confianza por tamaño de muestra es lineal y conservadora, mínimo entre 1 y n dividido 10: con 2 sitios de 10 da 0,20 y ese 0,20 se muestra tal cual. El sistema recién arranca y no lo disimulamos.

¿Por qué publicamos los puntajes de nuestro propio sitio?

Publicamos nuestros puntajes porque un producto de medición que esconde su medición es una promesa, no una herramienta. La primera corrida dio mal: 44/100 en la página de funciones era un aplazo con nuestra propia vara. Publicamos esa columna al lado de la corregida, y también la dimensión que sigue reprobada, porque un informe que sólo muestra lo que salió bien es publicidad con formato de auditoría.

Hay una razón práctica además de la de principios. Esta misma página es la demostración de la salida a la tensión que revelaron los puntajes: se puede ser honesto y denso al mismo tiempo, pero hay que publicar los datos que uno sí tiene —pesos, umbrales, límites, resultados propios— en vez de rellenar con estadísticas de mejora que nadie puede verificar. Un sitio genérico no es más honesto: es más cómodo.

Cada número de esta página tiene un origen declarado. Las bandas de confianza y los techos por procedencia se leen directamente del módulo que los define, así que no pueden discrepar. Los pesos de las siete dimensiones y de las diez señales están declarados junto a la página y hay un test automatizado que corre el motor y los compara uno por uno: si alguien recalibra el producto y no actualiza esta página, la suite falla en integración continua y el desajuste queda a la vista antes de publicarse. Los puntajes propios son de la corrida del 3 de agosto de 2026 y se actualizan a mano cuando se vuelve a medir.

Lo que no vas a encontrar en este sitio: reseñas, logos de clientes y porcentajes de mejora. No porque no sirvan, sino porque todavía no tenemos ninguno que podamos sostener con una medición. Cuando los haya, van a aparecer con su fecha y su procedencia, como todo lo demás.