Visibilidad en AI Search para B2B SaaS: qué medir más allá de un prompt en ChatGPT
Por qué un pantallazo de ChatGPT no es un benchmark — y las tres cosas que sí conviene medir.

Si quieres saber si tu B2B SaaS aparece cuando los compradores investigan con IA, no lo juzgues a partir de un único prompt en ChatGPT. Un prompt es una sola muestra de un sistema que cambia con la redacción, el mercado, el idioma, el momento y si el modelo hizo una búsqueda web. En su lugar, mide tres cosas sobre un conjunto fijo de preguntas de compra y varias superficies de IA: tasa de mención (¿te nombran?), inclusión en shortlist (¿estás en el conjunto recomendado?) y cuota de citas (en qué fuentes se apoyó la respuesta). Síguelas en observaciones repetidas para distinguir una brecha real de la varianza normal entre ejecuciones.
Para quién es
Esta guía es para SEO leads, heads of growth y product marketers de empresas B2B SaaS que han visto a un competidor nombrado en una respuesta de IA — o han visto su propia marca descrita de forma incorrecta — y ahora necesitan una manera defendible de medir el problema antes de gastar en un arreglo.
Úsala cuando montes por primera vez la medición de visibilidad en AI Search, o cuando alguien esté a punto de sacar una estrategia de un solo pantallazo.
Definiciones que conviene fijar
Algunos términos se usan indistintamente, y eso hace que los equipos midan lo que no toca:
- Visibilidad en AI Search es el resultado: con qué frecuencia y exactitud los asistentes de IA muestran tu marca ante las preguntas de tu categoría. Es lo que mides.
- GEO (Generative Engine Optimization) y AEO (Answer Engine Optimization) son los métodos: la estructura on-page y las señales off-site que cambias para mejorar ese resultado. Haces GEO/AEO; mides visibilidad en AI Search.
- Una superficie es un sistema de respuesta concreto con su propio comportamiento de recuperación y cita. Las relevantes son OpenAI con web search, Gemini con Google Search grounding, Perplexity Sonar, Claude con Anthropic web search, Microsoft Copilot/Bing, Google AI Overviews y Google AI Mode.
Separar resultado y método importa: no puedes probar que un método funcionó si nunca mediste el resultado con limpieza primero.
El método: mide el resultado, no la anécdota
1. Congela un conjunto pequeño de preguntas comerciales
Escribe entre 15 y 40 preguntas tal como las teclea un comprador en un asistente — “mejor [categoría] para [segmento]”, “[tú] vs [competidor]”, “¿[tú] cumple SOC 2?”, “¿[tú] se integra con [herramienta]?”. Cubre intención de categoría, caso de uso, comparativa, integración, seguridad y pricing. Congela este conjunto para que los resultados sean comparables semana a semana; mantén una lista aparte, sin congelar, para el discovery.
Punto de decisión: si no puedes nombrar al comprador y el momento de una pregunta, quítala. Un conjunto de medición no es un vertido de keywords.
2. Observa en varias superficies, no solo en una
Ejecuta cada pregunta en cada superficie que te importe y registra la respuesta literal — no tu recuerdo de ella. Anota si el modelo hizo búsqueda web, el mercado/locale, el idioma y la marca de tiempo. La misma pregunta en inglés y en español, o con y sin grounding, puede devolver marcas distintas.
3. Puntúa tres señales, por separado
Para cada respuesta, registra:
| Señal | Pregunta que responde | Por qué importa |
|---|---|---|
| Tasa de mención | ¿Te nombraron, sumando repeticiones? | Presencia base. Cero menciones es un problema distinto de “mencionado pero no recomendado”. |
| Inclusión en shortlist | ¿Estabas en el conjunto recomendado, o solo de pasada? | Que te nombren en una salvedad no es que te recomienden. |
| Cuota de citas | ¿En qué fuentes se apoyó la respuesta? | Dice por qué aparece una marca — tus páginas, un sitio de reviews, un hilo de Reddit, la comparativa de un competidor. |
4. Repite antes de concluir
Observa cada pregunta varias veces en una ventana corta antes de leer nada en los resultados. Si apareces en tres de cinco ejecuciones y un competidor en cinco de cinco, eso es señal. Si apareces una vez, es ruido hasta que se demuestre lo contrario.
Punto de decisión: fija tu ventana de observación antes de mirar los resultados, para no caer en la tentación de parar en cuanto los números te favorezcan.
Un ejemplo honesto
Toma una pregunta: “mejor software de análisis de contratos para equipos legales de mid-market.”
Una sola ejecución en ChatGPT nombra a tres competidores y a ti no. Sería fácil concluir que eres invisible. Pero repetir la pregunta cinco veces en varias superficies cuenta algo más útil:
- Te mencionan en 4/5 ejecuciones de OpenAI con web search, pero solo entras en shortlist en 1/5 — normalmente como “también vale la pena mirar”.
- En Perplexity Sonar entras en shortlist 3/5, y las citas apuntan a una comparativa de un tercero, no a tu propio sitio.
- En Google AI Overviews no apareces, y ninguna página tuya se cita para la pregunta.
Son tres brechas distintas — una brecha de posición dentro de la respuesta, una brecha de fuente de cita y una brecha de ausencia de página propia — y el primer pantallazo no revelaba ninguna. Cada una apunta a un arreglo diferente.
Las cifras anteriores son un ejemplo ilustrativo, no un dataset medido. Tus propios números las sustituyen.
Fallos comunes
- Tratar un prompt como benchmark. El error más común, y la razón por la que se construyen estrategias sobre ruido.
- Contar menciones como recomendaciones. “También puedes probar X” es una mención, no una plaza en la shortlist. Puntúalas por separado.
- Comparar cruzando una actualización del modelo. Si una superficie cambió de modelo o de recuperación entre observaciones, tu antes/después no es comparable — anótalo y vuelve a establecer baseline.
- Usar el tráfico referido por IA como prueba. Las respuestas suelen ser zero-click y los referrers a menudo se pierden. El tráfico es contexto, no evidencia de con qué frecuencia apareces.
- Medir solo ChatGPT. Las superficies difieren en recuperación y cita; la visibilidad en una no se transfiere a otra.
Limitaciones del método
Este método mide la visibilidad observada — lo que devuelven las superficies cuando se les pregunta. No ve dentro de los modelos cerrados, así que no prueba por qué un modelo eligió una fuente; solo puede mostrar la cita que una respuesta expuso. La ausencia de una cita no prueba ausencia de influencia. Y ninguna medición predice una respuesta futura: establece un baseline que puedes volver a observar tras un cambio, que es la forma honesta de hablar de impacto.
Checklist
- 15–40 preguntas con lenguaje de comprador, congeladas para medición.
- Cada pregunta asociada a un comprador y a un momento de compra.
- Cada superficie relevante observada, literal, con mercado/idioma/hora registrados.
- Tasa de mención, inclusión en shortlist y cuota de citas puntuadas por separado.
- Varias observaciones por pregunta dentro de una ventana prefijada.
- Cambios de modelo/método anotados para que el antes/después siga siendo comparable.
- Tráfico tratado como contexto, no como prueba.
Dónde encaja CitePatch
Hacer esto a mano en siete superficies y decenas de preguntas es donde se atasca la mayoría de los equipos. El AI Search Radar ejecuta las preguntas congeladas en las superficies de forma programada, guarda las respuestas literales y separa mención, shortlist y cita para que una brecha sea trazable hasta la evidencia que hay detrás — el punto de partida de un ajuste de contenido pequeño y revisable, en vez de otro dashboard.
Si prefieres verlo primero sobre tu propio dominio, la vía más rápida es lanzar un Free Audit contra tus preguntas de compra reales.
Preguntas frecuentes
- ¿Qué es la visibilidad en AI Search?
- La visibilidad en AI Search es con qué frecuencia, y con qué exactitud, los asistentes de IA muestran tu marca cuando un comprador investiga sobre tu categoría. Es el resultado que mides en superficies como ChatGPT, Gemini, Perplexity y Google AI — distinto del trabajo on-page y off-page (a menudo llamado GEO o AEO) que haces para mejorarlo.
- ¿Preguntar una vez a ChatGPT sirve para comprobar la visibilidad?
- No. Un solo prompt es una muestra de un sistema que varía según redacción, mercado, idioma, momento y si el modelo hizo o no búsqueda web. Una respuesta te dice que una marca apareció una vez; no te dice con qué frecuencia apareces, si te recomiendan o solo te mencionan, ni qué fuentes impulsaron la respuesta.
- ¿Qué debería medir un equipo B2B SaaS en lugar de un solo prompt?
- Mide tres cosas sobre un conjunto fijo de preguntas de compra y varias superficies: tasa de mención (¿te nombran?), inclusión en shortlist (¿estás en el conjunto recomendado?) y cuota de citas (en qué fuentes se apoyó la respuesta). Síguelas en observaciones repetidas para separar la señal de la varianza entre ejecuciones.
- ¿Qué superficies de IA importan para la visibilidad en B2B SaaS?
- Las superficies comercialmente relevantes son OpenAI con web search, Gemini con Google Search grounding, Perplexity Sonar, Claude con Anthropic web search, Microsoft Copilot/Bing, Google AI Overviews y Google AI Mode. Difieren en cómo recuperan y citan, así que aparecer en una no implica aparecer en otra.
- ¿El tráfico referido por IA demuestra visibilidad en AI Search?
- Por sí solo, no. La analítica de referrers en GA4 o GSC es contexto útil, pero las respuestas de IA suelen ser zero-click y los referrers a menudo se pierden o se atribuyen mal. Trata el tráfico como señal de apoyo, no como prueba de con qué frecuencia apareces dentro de las respuestas.