Tu puntuación de visibilidad en IA no predice si te van a citar
Dos papers de septiembre de 2026 lo midieron: las tácticas GEO recomendadas no mueven citas en ningún motor y un score sin motor predice casi nada.
Dos papers publicados en septiembre de 2026 midieron lo que hasta ahora era una suposición. Un score de contenido calculado sin preguntarle a ningún motor predice el orden de citación con un Spearman de 0,114. Las tres tácticas que todo el mundo recomienda para GEO no movieron las citas en ninguno de los diez motores probados. Y entre dos motores que responden a la misma pregunta, el solape de URLs citadas promedió 0,0079, con los cinco primeros enlaces compartidos en cero absoluto. Un número calculado sin mirar el motor no te dice si te van a citar, y la herramienta que te lo promete está vendiendo algo que sus propios datos no sostienen.
Los dos papers
El primero es "Scoring Without the Engine", de Elisha Bajemon y Andre-Louis Rochet, subido a arXiv el 7 de septiembre de 2026. Su objetivo declarado no es GEO, es validar un proxy barato para un oráculo caro y que cambia de comportamiento. GEO entra como dominio de demostración porque es el único campo que publica efectos causales medibles.
El segundo, "Scoring With the Engine", de Benjamin Tannenbaum, aparece en septiembre de 2026 y construye sobre el primero: si el paper anterior aísla qué pasa después de que un motor expone una página, este mide la capa que faltaba, qué expone el motor en primer lugar. Juntos cubren las dos preguntas de siempre: si la técnica funciona y si la herramienta de reporting mide algo.
Las tres tácticas ya no mueven nada
El playbook GEO sale del paper de Princeton de 2023, que reportó estas ganancias en Position-Adjusted Word Count: comillas de experto +42,6%, estadísticas +32,8% y citación de fuentes +27,7%. Ya revisamos la sección 6 de ese paper, la que casi nadie cita, y la brecha entre el número promocionado y el número medido en Perplexity ya aparecía ahí.
Ahora hay una medición más dura. Bajemon y Rochet repitieron las tres ediciones con un control que el estudio original no tenía: a cada edición de contenido le agregaron un bloque de relleno neutro de la misma longitud, para separar el efecto del contenido del efecto de haber escrito más.
El resultado, sobre 605 registros pareados:
| Táctica | Ganancia publicada (2023) | Efecto medido (n = 605) | Réplica gpt-5.x (n = 450) |
|---|---|---|---|
| Comillas de experto | +42,6% | −0,0009 (p = 0,82) | −0,0106 (p = 0,04 sin corregir) |
| Estadísticas | +32,8% | −0,0002 (p = 0,96) | −0,0066 (p = 0,25) |
| Citar fuentes | +27,7% | −0,0101 (p = 0,04 sin corregir, 0,13 con Bonferroni) | −0,0054 (p = 0,34) |
Ninguna se movió en la dirección publicada. Los dos intervalos que excluyen el cero son negativos. En el pooled más grande, en puntos porcentuales: comillas −0,33 (IC 95% −0,84 a +0,17, n = 1.531), estadísticas −0,28 (−0,97 a +0,43, n = 1.087), citar fuentes −0,79 (−1,53 a −0,14, n = 1.087).
Los motores: seis de pesos abiertos (mistral-medium-3.5, gemma-4-31b, nex-n2-pro, gpt-oss-120b, qwen3.5-122b y llama-3.3-70b), gemini-3.1-flash-lite, y una réplica de julio de 2026 sobre gpt-5.5, gpt-5.4 y gpt-5.4-mini con 150 consultas cada uno. En total, diez familias de motores y 229 consultas únicas.
Hay un detalle que debería incomodar a cualquiera que haya presentado un test GEO de 30 días. Un brazo intermedio con 41 consultas mostró un efecto positivo de comillas de +0,027. Con 100 consultas se había ido a +0,005. Los tests pequeños de GEO no fallan por mala fe, fallan por potencia.
Los autores acotan su propia conclusión: el régimen de prueba es un proxy controlado (cinco fuentes curadas, un formato de citación fijo, una métrica tipo PAWC), así que parte de la no transferencia podría ser un artefacto del marco y no de los motores. No dicen que las técnicas nunca funcionaron, dicen que ya no se puede afirmar que funcionan hoy.
El número que sobrevivió a su propio desmentido
Buscamos dónde seguía circulando el +33% de estadísticas y nos encontramos con una página actualizada en septiembre de 2026 titulada "How to Use Statistics to Boost AI Citations by 33% (2026 Data)". Su propia caja de actualización reporta el resultado del replication: −0,276 puntos porcentuales, intervalo de −0,970 a 0,425, n = 1.087. Es decir, el titular anuncia la ganancia y el párrafo de abajo dice que la ganancia no apareció.
Ese es el mecanismo completo de cómo un número se vuelve canónico: el resultado se convierte en un slide, el slide sobrevive al paper que lo mató, y tres años después el número cita con autoridad a un estudio que lo midió en cero. Si tu agencia sigue presentando "+33% de visibilidad con estadísticas", pregúntale qué muestra midió y contra qué control.
Un motor no representa a los demás
El paper de Tannenbaum hace la auditoría que faltaba. El 6 de junio de 2026 corrió las mismas 15 preguntas comerciales contra ChatGPT, Microsoft Copilot, Google y Perplexity, y registró 589 observaciones de citación: 528 URLs únicas, 356 dominios.
- Solape medio de URLs exactas entre dos motores para la misma pregunta: 0,0079 (IC 95% 0,0037 a 0,0132). La mediana es cero. El 84,9% de los pares de motores no compartió ninguna URL.
- En las diez preguntas que los cuatro motores respondieron, el solape de los cinco primeros enlaces fue exactamente cero en las 60 comparaciones posibles. No hay un núcleo compartido arriba de la lista: ningún par de motores compartió una URL dentro de sus cinco primeras posiciones.
- Un solo motor captura entre el 11,4% y el 42,6% de la unión de los cuatro (ChatGPT 42,6%, Google 24,3%, Perplexity 23,6%, Copilot 11,4%). Ninguno llega a la mitad.
- El 96,4% de las URLs observadas apareció en un solo motor.
- Al día siguiente, el mismo motor ya había cambiado el 67,0% de sus URLs (IC 95% 61,1% a 72,2%). Aun así, un motor consigo mismo al día siguiente fue unas 42 veces más parecido que dos motores el mismo día.
Medir un motor y tratarlo como "la búsqueda con IA" deja fuera la mayor parte de las fuentes que aparecen en otro. No mata el reporting de un motor, solo exige que digas cuál mediste y en qué fecha.
Qué sí y qué no puede un score sin motor
Volvamos al 0,114. Es la correlación de Spearman dentro de la misma consulta entre el score del paper y el orden de citación, sobre 777 grupos, con p = 1,5 × 10⁻⁹, y se replicó en 0,118 sobre los tres brazos gpt-5.x. Es señal real y estadísticamente sólida. También es pequeña: un score que solo mira el texto de la página explica una fracción mínima de quién sale citado.
El paper va más allá y prueba si un modelo más flexible lo mejora. Un ranker LambdaMART restringido a rasgos de contenido llega a 0,10 frente a 0,12 del score fijo: no le gana en consultas nuevas. Cuando el modelo recibe la consulta, la señal se triplica aproximadamente, hasta torno a 0,4. Y un ranker de solo regex, cuyo trabajo es comparar léxicamente la consulta con la fuente, llega a 0,222. La conclusión incómoda: lo que más pesa no es lo bien escrita que está tu página, es qué tan bien coincide con la pregunta concreta que hizo esa persona.
El score sí tiene una propiedad que ninguna herramienta de ranking ha demostrado: es difícil de manipular. Amplificar cualquiera de sus palancas calibradas gana como máximo 6 puntos, el premio baja con la dosis y no se acumula entre palancas. Como filtro de calidad de contenido vale. Como pronóstico de citación, no.
El marco de las cuatro cantidades
Tannenbaum propone dejar de mezclar lo que hoy se reporta en una sola cifra. Es el marco que adoptamos:
| Cantidad | Qué mide | Qué la puede medir | Qué no puede afirmar |
|---|---|---|---|
| Ajuste de página | Calidad y encaje del texto con una consulta | Score sin motor, auditoría editorial | Que el motor la va a exponer |
| Exposición | Si el motor buscó, recuperó y puso la página en contexto | Registro interno del motor, que nadie de fuera tiene | Que la exposición se convierte en citación |
| Selección condicional | De las expuestas, cuáles cita | Experimentos de conjunto fijo de candidatos | La visibilidad de punta a punta |
| Visibilidad final | Qué citó el motor para esa consulta | Auditoría con consulta fija, fechada, en más de un motor | Nada sin declarar motor y fecha |
La regla que sale de ahí: una cifra de visibilidad en IA sin motor declarado y sin fecha no es una probabilidad de ser citado, es una puntuación de página con un nombre ambicioso.
Qué reportamos hoy
Nada de esto nos lleva a dejar de medir, nos lleva a separar las cantidades. El protocolo que corremos:
- El score, si usamos uno, entra como puerta de calidad del pipeline de contenido, no como previsión de citas. Sirve para detectar páginas con densidad de datos baja o estructura ilegible, que es lo que hace bien.
- Las citas se leen con un panel de consultas fijo, fechado, en al menos dos motores. Ya escribimos que una captura de una respuesta es una muestra, no un resultado, y con un 67% de cambio diario esa regla pesa más que hace un mes.
- En Search Console se reportan las páginas del informe de IA generativa junto con posición como rango con advertencia, no como ranking, porque ahí Google sigue contando el bloque entero como un solo resultado.
- Los indicadores que sobreviven a un cambio de definición quedan aparte: páginas citadas, búsqueda de marca, tráfico directo.
- Antes de contratar o renovar una herramienta, le pedimos a la agencia que demuestre qué mide exactamente y contra qué. Si la respuesta es un número sin motor y sin fecha, no es una medición.
Qué hacer esta semana
Coge el último informe de visibilidad en IA que tengas y anota tres cosas al lado de cada cifra: qué motor, qué consulta y qué fecha. Sin las tres, la cifra no se defiende delante de un cliente.
Después revisa el contenido que estás "optimizando para GEO". Si el plan es añadir estadísticas cada 200 palabras para subir un 33%, esa cifra ya se midió en diez motores y salió en cero. Mueve el esfuerzo a lo que sí mueve la señal: que la página responda la consulta concreta con la que esperas que te encuentren, en los primeros párrafos.
La medición de visibilidad en IA va a seguir siendo aproximada durante mucho tiempo, y un número aproximado se defiende si lleva motor y fecha. Lo que no se defiende es facturar una puntuación de página como si fuera una predicción de citación.
Preguntas Frecuentes
¿Qué tan bien predice un score de contenido las citas de IA?
En el estudio de Bajemon y Rochet de septiembre de 2026, un score calculado solo con el texto de la página alcanzó un Spearman de 0,114 dentro de la misma consulta en 777 grupos, y 0,118 al replicarse fuera de familia en tres motores gpt-5.x. Es señal real, pero débil: sirve como filtro de calidad, no como pronóstico de citación.
¿Sirve de algo agregar estadísticas y citas para salir en ChatGPT?
No se demostrado en motores actuales. Las tres tácticas más fuertes del paper de Princeton (comillas de experto, estadísticas y citar fuentes) no movieron las citas en ninguno de diez motores probados con ediciones pareadas y controladas por volumen. Lo que sí queda es la relevancia respecto a la consulta: un modelo con la consulta de entrada casi triplica la señal de un score que solo mira la página.
¿Puedo usar un motor como muestra de la búsqueda con IA?
Como muestra, sí, si dices que es una muestra. En una auditoría de cuatro motores con las mismas 15 preguntas, el solape medio de URLs entre dos motores fue 0,0079 y el solape de los cinco primeros fue cero en las 60 comparaciones. El 96,4% de las URLs citadas apareció en un solo motor, así que una lectura de un motor deja fuera la mayor parte de lo que dicen los demás.



