La revista científica Latitude: Multidisciplinary Research Journal, editada por Quality Leadership University (QLU) en Ciudad de Panamá, ha lanzado en su volumen 2, número 24 (2026), el estudio titulado «Medición de la presencia de marca en la optimización para motores generativos: una revisión de alcance sobre métricas y validez», el cual cuenta con la firma de Néstor Romero-Ramos, Yulianna Lobach, David Abreu-Abreu, Isaac Castillo-Hernández, Juan Carlos García-Cordero y Daniel García-Cordero. Dicha investigación, accesible libremente en la web, constituye el pionero de los frutos dados por la línea investigativa centrada en Generative Engine Optimization (GEO) que Centria Group impulsa en colaboración con centros universitarios y académicos de cuatro naciones.
Este texto aborda una cuestión que el marketing digital actual aún no logra resolver con precisión: al sugerir un hotel, un seguro o una entidad bancaria, ¿de qué manera se evalúa la aparición de una firma en dicha contestación, qué nivel de protagonismo ostenta y cuán confiable resulta? Con el fin de despejar esta duda, el grupo llevó a cabo una revisión sistemática exploratoria (scoping review) basada en la metodología del Joanna Briggs Institute (JBI) y documentada de acuerdo con la pauta PRISMA-ScR, examinando de manera ordenada la forma en que los estudios recientes evalúan la visibilidad, la mención y la inclusión de marcas y fuentes dentro de los motores basados en inteligencia artificial.
«Por espacio de casi veinte años, la presencia online se evaluaba mediante un criterio muy específico: figurar (y recibir clics) en un repertorio de búsquedas. Actualmente, el consumidor ya no se topa con diez vínculos azules; en su lugar, obtiene una contestación condensada que agrupa y reelabora múltiples procedencias, mencionándolas de manera fragmentaria o asimétrica. La cuestión fundamental ha dejado de centrarse en si nuestro enlace sobresale y es accionado, transformándose en averiguar si nuestra información figura explícitamente en la solución que el internauta consume de verdad», señala Néstor Romero, investigador firmante de la investigación y COO de Centria Group.
Del clic a la respuesta: por qué las métricas del SEO dejan de servir
El texto arranca a partir de una premisa que la propia muestra analizada corrobora mediante datos empíricos: las referencias empleadas por una herramienta conversacional coinciden escasamente con los resultados orgánicos del buscador convencional, al tiempo que los criterios de elección difieren entre plataformas. En otras palabras, aparecer en los primeros puestos de Google no garantiza la presencia en un agente conversacional, circunstancia que anula la extrapolación de métricas y exige replantizar las estrategias de medición. A este escenario se une la tendencia de las búsquedas sin clics, impulsada por las síntesis automáticas dentro de los navegadores: gran parte de las dudas de los internautas se satisfacen actualmente sin que accedan a ninguna página web.
«La proporción de citas se considera una métrica clave en el ámbito profesional, mientras que en la investigación científica aparece sistematizada en una única investigación. Dicho desfase entre el sector y la academia constituye un descubrimiento por derecho propio», afirmó Néstor Romero.
Las cinco preguntas de investigación y sus respuestas
|
RQ |
Pregunta |
Respuesta del estudio |
|
RQ1 |
¿Qué familias de métricas se emplean? |
Se utilizan siete conjuntos parcialmente coincidentes —menciones o citas, relevancia o ubicación, impacto o alcance, posición en listados, consistencia, tono o enfoque, y porcentaje de citación— carentes de un esquema unificador común. |
|
RQ2 |
¿Sobre qué unidad de análisis se operacionalizan? |
Falta unanimidad: el objeto de estudio transita desde la dirección o fuente web —heredada directamente del SEO— hasta la firma o entidad, el archivo, el artículo y, en las investigaciones más actuales, el recorrido de navegación de los agentes. Aquellas investigaciones con objetos diferentes carecen de comparabilidad directa. |
|
RQ3 |
¿Cómo se controla la variabilidad estocástica de los motores? |
Únicamente una fracción menor implementa réplicas o cálculos formales del azar. La gran mayoría recurre a una única consulta o limita un periodo de tiempo, omitiendo la medición de la incertidumbre. |
|
RQ4 |
¿Qué evidencia de fiabilidad y validez se reporta? |
Ninguna investigación del conjunto somete su herramienta a comprobación psicométrica. Se observan supervisiones periféricas y fragmentarias (constancia, precisión en la fuente, contraste metodológico, solidez ante alteraciones). La consistencia entre evaluadores rara vez se documenta. |
|
RQ5 |
¿Existe un instrumento integrado y validado de presencia generativa? |
Negativo. Las pruebas estándar miden el rendimiento de estrategias o variaciones de posición, mas no la consistencia teórica de un indicador; las investigaciones iniciales desarrollan mediciones prácticas pero fragmentadas y carentes de fiabilidad comprobada. |
Cómo se hizo: cuatro rutas de búsqueda y una política explícita de preprints
Cuatro vías complementarias integraron la búsqueda, ideadas para contrarrestar los puntos débiles de cada método: un sistema de hallazgo impulsado por inteligencia artificial, búsquedas multilingües y replicables en OpenAlex, seguimiento de referencias mediante nodos clave y comprobación en una plataforma indexada (Web of Science; Scopus no estuvo disponible). Una vez eliminados los duplicados por DOI —evitando el título debido a los frecuentes conflictos entre denominaciones genéricas dentro de esta disciplina—, dos evaluadores filtraron los registros analizando los resúmenes de manera autónoma, logrando acuerdos consensuados ante cualquier desacuerdo. Treinta y seis informes completos fueron valorados, seleccionándose veintitrés investigaciones principales, además de un par de revisiones catalogadas de forma independiente a modo de sustento teórico.
«Una gran porción del saber producido en castellano acerca de este asunto no logra trascender hacia los ámbitos internacionales. Rescatarlo va más allá de un simple afán de completitud: pone al descubierto un prejuicio idiomático latente dentro de la disciplina», puntualizó Néstor Romero.
Siete familias de métricas y ningún marco que las integre
El mapeo reconoce siete agrupaciones de indicadores que se superponen parcialmente —aparición o mención, visibilidad o emplazamiento, asimilación o peso, posicionamiento en listados, consistencia, tono o enfoque y porción de menciones— y que operan careciendo de un estándar unificador común. Asimismo, la investigación subraya que el límite conceptual más fructífero de esta disciplina radica en la diferenciación entre la citación, entendida como la selección de una fuente, y la asimilación, definida como la integración real de sus contenidos dentro del texto resultante; esto representa una escisión en un par de niveles de aquello que anteriormente se evaluaba de forma binaria.
La unidad de análisis cambia: de la URL a la marca y a la trayectoria de los agentes
Todavía no hay acuerdo acerca de qué se mide con precisión. Los textos muestran una evolución constante que parte de la procedencia o la URL —legado directo del posicionamiento orgánico— para centrarse en la firma o entidad, el archivo, el artículo y, en las investigaciones más recientes, en elementos más amplios como el recorrido de navegación de los usuarios. Dicha transformación evidencia un cambio en el enfoque de la disciplina, aunque esto conlleva un precio: al emplear parámetros diferentes, las investigaciones pierden comparabilidad directa, lo cual imposibilita la elaboración de metaanálisis.
Tipología de la evidencia disponible
|
Grado de evidencia |
Casos de estudio |
Relevancia en el corpus |
|
Benchmark de evaluación |
GEO-Bench (Nimase et al., 2026); SAGEO Arena (Kim et al., 2026); E-GEO (Bagga et al., 2025); C-SEO Bench (Puerto et al., 2025) |
Predominante |
|
Medición primaria (motores reales) |
How to Dominate (Chen et al., 2025); Strategic GEO (Khedekar y Bansal, 2026); Quintana-Gómez (2026) |
Escasa |
|
Estudio aplicado / comercial |
GEO at Scale (Kumar, 2026); Brand Notability UK (Oruesagasti, 2026) |
Reducida |
Fuente: Romero-Ramos et al. (2026), Tabla 3 del manuscrito original. Versión propia.
La IA no responde siempre lo mismo, y casi nadie lo mide
Debido a que los motores generativos funcionan de manera estocástica, son capaces de arrojar contestaciones diferentes frente a una idónea consulta idéntica. Por consiguiente, lograr una evaluación confiable demanda replicar las mediciones o representar formalmente la incertidumbre. Pese a ello, tan solo una minoría de las investigaciones adopta este enfoque de modo metódico. Entre los pocos que lo implementan sobresalen proyectos que realizan cinco corridas por cada consulta, que efectúan doscientos exámenes junto con permutaciones de orden, que llevan a cabo análisis de sensibilidad orientados al idioma y a las paráfrasis, o bien aquellos que abordan la visibilidad en calidad de distribución en vez de un número estático. El resto de los trabajos, en su mayor parte, confía en una sola ejecución.
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil. Cualquier instrumento robusto tiene que incorporar la repetición y la modelización de la incertidumbre como requisito, no como un refinamiento opcional», señala Romero.
El hallazgo central: un campo que mide mucho y valida poco
El hallazgo fundamental de la investigación revela que ningún análisis del conjunto somete su herramienta de medición a un proceso de validación psicométrica riguroso. En su lugar, se implementan supervisiones periféricas y fragmentadas (como índices de estabilidad, certeza en la asignación, contrastación metodológica o solidez ante secuencias), mientras que la concordancia entre evaluadores —un estándar elemental para cualquier dispositivo— rara vez se documenta. Por su parte, la validez, al momento de defenderse, se sustenta en la armonía interna de referencias diseñadas específicamente para la ocasión en lugar de apoyarse en atributos métricos. De este modo se desprende la premisa principal del análisis: aún no se cuenta con un mecanismo consolidado y verificado para cuantificar el impacto generativo de marca.
Requisitos de admisión
|
Parámetro |
Adisión |
Descarte |
|
Enfoque |
Cuantificación u operacionalización del impacto, la presencia, la visibilidad o las menciones dentro de plataformas generativas |
Posicionamiento web tradicional, diseño asistido por ordenador (CAD), redes generativas antagónicas (GAN), motores recomendadores y demás aplicaciones ajenas a este ámbito |
|
Periodo |
2023-2026 (ámbito nativo digital) |
Previo a 2023 |
|
Idioma |
Castellano e inglés |
Idiomas restantes que carezcan de traducción accesible |
|
Clasificación |
Investigaciones originales de medición, pruebas comparativas de desempeño o análisis prácticos provistos de métricas |
Artículos de opinión, editoriales y material de índole comercial |
|
Condición |
Se aceptan preprints conforme a los criterios de sensibilidad establecidos |
Documentación informal difundida sin supervisión editorial |
Fuente: Romero-Ramos et al. (2026), Tabla 1 del artículo original. Traducción propia.
«Hallamos un terreno sumamente amplio pero escasamente contrastado. A las propuestas métricas, lejos de escasear, les sobra presencia; lo que escasea en realidad es consistencia conceptual y rigor contrastable. Conviene precisarlo sin rodeos, ya que equiparar un indicador estándar con una herramienta contrastada sobreestima el supuesto desarrollo metodológico de la disciplina. Precisamente ahí radica el nicho científico», sostiene Néstor Romero.
Existe una separación entre la enseñanza académica y la labor profesional
El texto expone una discrepancia notable entre aquello que el sector valora como prioritario y lo que la investigación académica ha consolidado. La participación en citas (citation share) —un indicador al que la actividad laboral otorga un carácter determinante y ve como un candidato ideal para lograr validez convergente— se sustenta fundamentalmente en una única investigación. Del mismo modo, el conjunto vinculado al sentimiento y al encuadre cuenta con un respaldo igual de limitado, a pesar de que la investigación más amplia del conjunto, la cual examina más de un centenar de marcas, la señala como el indicador más volátil de todos.
«La visibilidad en Google no predice la visibilidad en un asistente generativo. Eso invalida la transferencia directa de indicadores y obliga a repensar qué medimos y cómo».
«La visibilidad generativa es manipulable, y eso traslada a la medición un requisito que normalmente no se le exige: la robustez frente a la manipulación como propiedad del instrumento».
La ciencia en español, invisible: una lección metodológica
Asimismo, este análisis arroja una aportación metodológica de suma relevancia para los investigadores de habla hispana. Hay un corpus de estudios en español, divulgado en publicaciones de Documentación y Biblioteconomía, que examina la exposición ante la inteligencia artificial generativa desde perspectivas diversas —tales como la inestabilidad de las marcas dentro de las sugerencias turísticas elaboradas por IA, o bien el ajuste de los repositorios académicos para facilitar su indexación por parte de plataformas generativas—, aspectos que los textos anglosajones hegemónicos suelen soslayar. Su rescate únicamente se logró por medio de consultas en varios idiomas, lo cual pone de manifiesto un sesgo idiomático subyacente en esta disciplina.
A ello se suma una segunda lección del propio proceso: la verificación en una base indexada aportó 360 registros brutos, de los que se revisaron los 136 en acceso abierto, en su mayoría ruido temático por colisión de términos, y no incorporó ningún estudio de medición elegible nuevo. El campo es, en definitiva, preprint-first y está infracubierto por la indexación tradicional: el 64 % del corpus candidato se difunde a través de arXiv o SSRN y el 98 % carece de cuartil indexado.
«Este resultado lo reportamos como hallazgo metodológico y no como una limitación escondida. En un campo born-digital, la revista no funciona como indicador de calidad, y las herramientas de descubrimiento asistidas por IA tienden a infracubrir precisamente la evidencia revisada por pares y los benchmarks más relevantes. Hay que complementarlas con rastreo de citas y fuentes reproducibles», explica el investigador.
Proceso para elegir los estudios (PRISMA-ScR, dos ramas)
|
Etapa |
Resultado |
|
Rama de descubrimiento (Consensus) |
70 registros identificados; 23 eliminados antes del cribado (duplicados por DOI, limpieza y falsos positivos por colisión de siglas); 47 cribados por resumen; 26 excluidos; 21 pasan a texto completo |
|
Rama de otros métodos |
18 registros adicionales (rastreo de citas, OpenAlex y verificación en base indexada); 15 candidatos a texto completo |
|
Verificación en Web of Science |
360 registros brutos; 136 revisados (acceso abierto); ningún estudio de medición elegible nuevo |
|
Evaluación a texto completo |
36 informes evaluados; 13 excluidos (fuera de alcance o sin medición directa de la presencia) |
|
Inclusión final |
23 estudios primarios incluidos en la síntesis, más 2 revisiones registradas como marco conceptual |
Fuente: elaboración propia a partir de la Figura 1 y del apartado «Selection process» de Romero-Ramos et al. (2026). Los autores detallan que las cifras correspondientes a la identificación y el cribado son definitivas, mientras que aquellas relativas a la evaluación del texto íntegro y la incorporación siguen siendo provisionales.
La visibilidad generativa es susceptible de manipulación
Un subconjunto de los trabajos revisados demuestra que la visibilidad en motores generativos es manipulable de forma adversarial, mediante técnicas de manipulación del ranking en buscadores conversacionales o mediante optimización sigilosa de prompts. El estudio traslada esa evidencia al terreno de la medición: la robustez frente a la manipulación debería formar parte de las propiedades exigibles a cualquier instrumento de presencia.
«Una prueba de rendimiento comprueba si una estrategia resulta eficaz o si un elemento varía de posición, pero no determina si un indicador mide adecuadamente un constructo. Mezclar ambos planos magnifica el grado de desarrollo ficticio de la disciplina».
«Una medición de una sola ejecución es, en este dominio, epistemológicamente frágil: los motores generativos pueden responder distinto a la misma pregunta».
Qué viene ahora: del diagnóstico al instrumento
Los investigadores concluyen que la carencia hallada —en lo referente a la validez de constructo y a la fiabilidad constatada— representa el resquicio que legitima la creación y validación formal de un indicador específico de presencia generativa, planteando dicha labor como la prolongación lógica del estudio difundido, y descartándola como una hipótesis ya ratificada. Se trata justamente de la senda en la que el grupo se encuentra laborando durante la etapa posterior.
«El propósito que perseguimos consiste en transitar desde el diagnóstico hasta la herramienta práctica: diseñar y contrastar un indicador accesible para cualquier tipo de empresa, sin importar su dimensión, permitiéndole medir con rigor científico el impacto de su marca en las respuestas generadas por la inteligencia artificial», señala Néstor Romero.
Restricciones expuestas por los investigadores
El artículo reconoce abiertamente sus propias fronteras: la precariedad de los cimientos empíricos en una disciplina tan novísima y copada por preprints, lo cual vuelve provisorias las deducciones; la imposibilidad de replicar el trayecto de hallazgo original —atenuada, sin desaparecer por completo, gracias a OpenAlex, el seguimiento de citas y el cotejo indexado—; el acotamiento idiomático a inglés y castellano junto con la carencia de acceso institucional para validar en Scopus; un etiquetado ejecutado en parte sobre los resúmenes, con métricas de incorporación sujetas a revisión; un riesgo inminente de circularidad, puesto que múltiples investigaciones utilizan modelos de lenguaje para evaluar su propio desempeño; y la caducidad temporal intrínseca a cualquier radiografía de un sector que se sustenta sobre herramientas propietarias en mutación permanente.
Estas limitaciones son fundamentales para interpretar adecuadamente los resultados y comprender el alcance de la evidencia disponible. Para consultar en profundidad la metodología, los datos analizados y las conclusiones de la investigación, descarga el informe completo «La banca panameña ante la inteligencia artificial».
