La publicación científica Latitude: Multidisciplinary Research Journal, dirigida por Quality Leadership University (QLU) en Ciudad de Panamá, dio a conocer en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con las firmas de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos difundidos dentro de la línea de estudio centrada en Generative Engine Optimization (GEO) que Centria Group impulsa de la mano de diversas entidades universitarias y académicas de cuatro naciones.
El artículo aborda una incógnita que el marketing digital aún no ha logrado resolver con precisión: al sugerir un hotel, una aseguradora o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de esclarecerlo, el grupo llevó a cabo una revisión de alcance o scoping review, apegándose a la metodología del Joanna Briggs Institute (JBI) y documentada conforme a la directriz PRISMA-ScR, la cual traza sistemáticamente el modo en que las publicaciones recientes evalúan la visibilidad, el posicionamiento y la mención de marcas y referencias dentro de los motores de respuesta generativa.
«Por espacio de cerca de veinte años, la presencia en la red se evaluaba mediante una destreza muy específica: salir en un índice de opciones y recibir clics. Actualmente, las personas ya no se encuentran con diez vínculos azules; ahora obtienen una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o desequilibrada. El cuestionamiento fundamental ya no se centra en si mi dirección web figura y es seleccionada, sino en si mis materiales forman parte de la contestación que el consumidor verdaderamente visualiza», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La proporción de citas se considera una métrica clave en el ámbito profesional, mientras que en la investigación científica aparece sistematizada en una única investigación. Dicho desfase entre el sector y la academia constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación junto con sus respuestas
RQ | Pregunta | Respuesta del estudio |
RQ1 | ¿Qué familias de métricas se emplean? | Siete familias parcialmente solapadas —aparición/citación, prominencia/posición, absorción/influencia, ranking en listas, estabilidad, sentimiento/encuadre y cuota de citación— sin ningún marco integrador compartido. |
RQ2 | ¿Sobre qué unidad de análisis se operacionalizan? | No hay consenso: la unidad migra de la fuente/URL —herencia directa del SEO— hacia la marca o entidad, el documento, el producto y, en los trabajos más recientes, la trayectoria de navegación de agentes. Estudios con unidades distintas no son directamente comparables. |
RQ3 | ¿Cómo se controla la variabilidad estocástica de los motores? | Solo una minoría aplica repetición o modelización explícita de la incertidumbre. La mayoría se apoya en una única ejecución o en acotar una ventana temporal, sin cuantificar la incertidumbre. |
RQ4 | ¿Qué evidencia de fiabilidad y validez se reporta? | Ningún estudio del corpus somete su instrumento a validación psicométrica. Existen controles adyacentes y aislados (estabilidad, fidelidad de la atribución, triangulación por diseño, robustez al orden). La fiabilidad intercodificadores apenas se reporta. |
RQ5 | ¿Existe un instrumento integrado y validado de presencia generativa? | No. Los benchmarks evalúan la eficacia de tácticas o cambios de rango, no la validez de constructo de una medida; los estudios primarios operacionalizan métricas útiles pero parciales y sin fiabilidad documentada. |
Metodología: cuatro vías de búsqueda junto con una política clara de preprints
Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.
«Una gran porción del saber producido en español acerca de este tema no logra trascender hacia los circuitos globales. Rescatarlo va más allá de un asunto de mera exhaustividad: pone de manifiesto un sesgo idiomático subyacente en la disciplina», subrayó Néstor Romero.
Siete grupos de indicadores y ningún modelo que los unifique
El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.
La unidad de análisis cambia: de la URL a la marca y a la trayectoria de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran una evolución constante que parte de la procedencia o la URL —legado directo del posicionamiento orgánico— para centrarse en la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, en elementos más amplios como el recorrido de navegación de los usuarios. Dicha transformación evidencia un cambio en el enfoque de la disciplina, aunque esto conlleva un precio: al emplear parámetros diferentes, las investigaciones pierden comparabilidad directa, lo cual imposibilita la elaboración de metaanálisis.
Tipología de la evidencia disponible
Grado de evidencia | Casos de estudio | Relevancia en el corpus |
Benchmark de evaluación | GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) | Predominante |
Medición primaria (motores reales) | How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) | Escasa |
Estudio aplicado / comercial | GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) | Reducida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del artículo original. Traducción propia.
La inteligencia artificial no siempre contesta igual, y prácticamente nadie lo evalúa
Los motores generativos son estocásticos: pueden ofrecer respuestas distintas ante la misma pregunta. Una medición fiable exige, por tanto, repetir las mediciones o modelar explícitamente la incertidumbre. Sin embargo, solo una minoría de los estudios lo hace de forma sistemática. Entre quienes sí lo aplican destacan trabajos con cinco ejecuciones por consulta, con 200 evaluaciones y permutaciones de orden, con análisis de sensibilidad para idioma y paráfrasis, o que tratan la visibilidad como una distribución en lugar de como un valor puntual. La mayoría restante se apoya en una única ejecución.
«En este ámbito, evaluar un único intento resulta epistemológicamente frágil. Todo instrumento sólido debe integrar la repetición y el cálculo de la incertidumbre desde el inicio, y no como un simple añadido», apunta Romero.
El descubrimiento principal: un terreno que mide en exceso y verifica de forma escasa
El hallazgo definitivo del análisis indica que ningún artículo del corpus somete su herramienta de medición a un proceso de validación psicométrica rigurosa. En su lugar, se implementan revisiones accesorias y fragmentadas (como índices de estabilidad, certeza en la atribución, contraste metodológico por diseño o solidez frente al orden), mientras que la concordancia entre evaluadores, que constituye una condición elemental para cualquier instrumento, rara vez se documenta. Por otra parte, la validez, cuando se defiende, se apoya en la consistencia interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos de medición propiamente dichos. De este modo, se desprende la premisa fundamental del mapeo: todavía carecemos de un mecanismo unificado y contrastado capaz de cuantificar la huella generativa de marca.
Criterios de elegibilidad
Parámetro | Adisión | Descarte |
Enfoque | Cuantificación u operacionalización del impacto, la presencia, las menciones o la visibilidad dentro de los motores generativos | Posicionamiento tradicional en buscadores, diseño asistido por computadora (CAD), redes generativas antagónicas (GAN), motores de recomendación y aplicaciones ajenas a este ámbito |
Rango temporal | 2023-2026 (ámbito de nacimiento digital) | Precedente al año 2023 |
Lengua | Castellano e inglés | Idiomas restantes que carezcan de traducción accesible |
Clasificación | Investigación empírica de medición, evaluación comparativa o trabajo práctico dotado de métricas | Artículos de opinión, editoriales y material comercial o publicitario |
Condición | Preprints aceptados conforme a los criterios de sensibilidad | Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Encontramos un campo que mide mucho y valida poco. Lo que falta no son ideas de medición, que abundan: lo que falta es validez de constructo y fiabilidad documentada. Y conviene decirlo con precisión, porque confundir un benchmark con un instrumento validado infla la aparente madurez metodológica del campo. Ese vacío es, exactamente, la oportunidad científica», afirma Néstor Romero.
Una brecha entre la práctica profesional y la academia
El artículo documenta una discrepancia notable entre aquello que la industria prioriza y lo que la investigación científica ha consolidado. La cuota de citación (citation share) —un indicador al que el sector otorga un valor determinante y presupone como una opción idónea para la validez convergente— se reduce, en la práctica, a un único estudio formalizado. Por otra parte, las categorías de sentimiento y encuadre muestran una escasez similar, a pesar de que el análisis de mayor envergadura dentro del corpus, el cual evalúa más de cien marcas, las señala como los indicios más volátiles de todo el conjunto.
«La visibilidad en Google no garantiza la presencia en un asistente generativo, lo que invalida la transferencia directa de métricas y exige replantear tanto qué evaluamos como la manera de hacerlo».
«La visibilidad generativa se puede manipular, lo cual impone a la medición una exigencia que por regla general no se le pide: la solidez ante la manipulación en calidad de atributo del instrumento.»
La ciencia en español, invisible: una lección metodológica
La revisión aporta además un hallazgo metodológico de interés directo para la comunidad hispanohablante. Existe un estrato de investigación en español, publicado en revistas de Biblioteconomía y Documentación, que aborda la visibilidad ante la IA generativa desde ángulos complementarios —la volatilidad de la presencia de marca en recomendaciones turísticas generadas por IA, o la optimización de repositorios académicos para su rastreo por motores generativos— y que la literatura anglófona dominante tiende a pasar por alto. Su recuperación solo fue posible mediante búsqueda multilingüe, lo que evidencia un sesgo lingüístico latente en el campo.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso de elección de estudios (PRISMA-ScR, dos ramas)
| Fase | Hallazgo |
| Fase de búsqueda (Consensus) | Se identificaron 70 registros; 23 descartados de forma previa al filtrado (duplicados por DOI, depuración y falsos positivos debidos a colisión de siglas); 47 sometidos a revisión por resumen; 26 descartados; 21 evaluados a texto completo |
| Fase de métodos complementarios | 18 referencias adicionales (búsqueda de citas, OpenAlex y comprobación en bases indexadas); 15 elegibles para texto completo |
| Comprobación en Web of Science | 360 registros iniciales; 136 analizados (de acceso abierto); ningún nuevo trabajo de medición apto |
| Revisión del texto completo | Se examinaron 36 informes; 13 descartados (por no ajustarse al alcance o carecer de medición directa de presencia) |
| Selección definitiva | Se incorporaron 23 investigaciones primarias a la síntesis, además de 2 revisiones documentadas como marco teórico |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Las cifras de identificación y cribado se muestran definitivas, mientras que los datos de evaluación a texto completo e inclusión resultan provisionales, de acuerdo con la declaración de los autores.
La visibilidad generativa es susceptible de manipulación
Cierta parte de la investigación analizada evidencia que la exposición en los motores generativos resulta manipulable de manera adversarial, ya sea a través de tácticas de alteración de posiciones en los buscadores conversacionales o mediante la optimización discreta de prompts. Dicha investigación traslada esta conclusión al ámbito de la métrica: la solidez frente a los intentos de manipulación tendría que integrar el conjunto de atributos indispensables para cualquier herramienta de visibilidad.
«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».
Próximos pasos: del diagnóstico a la herramienta
Los creadores del estudio deducen que el déficit hallado, concretamente en la fiabilidad documentada y en la validez de constructo, representa el hueco idóneo que legitima la creación y validación formal de un indicador propio centrado en la presencia generativa. Del mismo modo, consideran esta labor como el paso lógico que sucede al artículo difundido, descartando que se trate de un hecho ya comprobado. Precisamente, este es el camino que el grupo investiga en la etapa venidera.
«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.
Limitaciones declaradas por los autores
El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.
Resulta indispensable considerar estas restricciones con el fin de evaluar correctamente los hallazgos y dimensionar el alcance de las pruebas existentes. Si deseas profundizar en la metodología, las cifras examinadas y las conclusiones del estudio, descarga el informe completo «La banca panameña ante la inteligencia artificial».

.jpg)