Publicado en nicolasbillia.com — Julio 2026
Disclaimer
Este contenido fue generado con ayuda de IA a partir de la ingesta de contexto: los logs completos de un pipeline de auditoría de visibilidad en motores generativos que corrí para un cliente B2B de staffing en LATAM que vende a empresas de USA, más los outputs crudos de cada motor (JSON por prompt y por motor). Todos los porcentajes salen de esos outputs; las interpretaciones son mías. Por confidencialidad no nombro al cliente y todos los datos son relativos — sin absolutos de tráfico ni de negocio.
Corrí los mismos 30 prompts de negocio contra AI Overviews, ChatGPT y Claude. La pregunta era simple: cuando un buyer le pregunta a la IA “¿a quién contrato para X?”, ¿de dónde saca los nombres cada motor?
La respuesta corta: los tres motores eligen fuentes con mecánicas distintas, y “optimizar para la IA” como si fuera un solo canal es una estrategia rota de nacimiento. Este post documenta la metodología, los patrones de retrieval por motor, y las dos o tres cosas que me sorprendieron de verdad.
Contenido del post
- Metodología — de dónde salen los 30 prompts y qué corre el pipeline
- AI Overviews: la bola de nieve — nadie es recomendado sin estar en las fuentes
- ChatGPT: 82% de las citas son home o landing del proveedor (y suprime listicles propios)
- Claude: 64% editorial — la especialización le gana a la frecuencia (y el disclaimer que muestra)
- Plataformas de reviews: solo Clutch pesó. G2, Trustpilot y Glassdoor: cero
- El contraste diagnóstico: a lo flojo Google lo degrada, a lo self-promote lo expulsa
- El loop cerrado: el primer lead con atribución dura a un asistente de IA
- Implicancias: una estrategia por motor, no una estrategia “para la IA”
- Gotchas técnicos del pipeline
0. Metodología — de dónde salen los 30 prompts
El error típico de estos experimentos es inventar los prompts — o peor, pedirle a un LLM que los genere. Acá salieron de una fuente real: Search Console. Pull de query × page de 6 meses, filtro semántico del negocio, y curaduría de 30 prompts reales — short-tail y conversacionales — mapeados sobre las tipologías de contenido MOFU-BOFU del negocio del cliente (staffing B2B en LATAM para empresas de USA):
- Conversacionales (MOFU research) — preguntas completas del buyer evaluando opciones: “what are the best companies to…”, “we want to compare providers for…”
- Listicles (MOFU consideración) — “best/top [servicio] providers”: el buyer ya sabe qué necesita y arma su short list
- Hire/transaccionales (BOFU decisión) — “hire [talento] from [región]”: intención de contratación directa
- Servicio (categoría) — la categoría a secas, tal como se tipea
Este mapeo por funnel no es cosmético: como se ve en la sección 5, cada motor cambia el tipo de página que cita según el cluster de prompt — y esa es la tabla que ordena todo el plan de trabajo.
El pipeline corre cada prompt contra los 3 motores: AI Overviews vía DataForSEO (SERP + load_async_ai_overview), ChatGPT y Claude vía los endpoints de ai_optimization con web search habilitado (mercado US). Cache por prompt × motor para no re-pagar corridas. Después: fetch de las 107 fuentes que citó AIO, grep de ~80 marcas del vertical sobre cada fuente, y matriz de quién aparece dónde.
Costo total de la corrida completa: ~6 dólares. Eso convierte lo que era “un estudio” en un panel mensual.
1. AI Overviews: la bola de nieve
22 de los 30 prompts dispararon AI Overview. El patrón más claro de todo el experimento: nadie es recomendado sin estar antes en las fuentes que el AIO cita. Y la correlación fuente → recomendación es casi mecánica. Los 3 dominios más usados como fuente son exactamente las 3 marcas más recomendadas:
| Marca | Share de las citas-fuente de AIO | Prompts donde AIO la recomienda |
|---|---|---|
| Marca #1 | 13% de todas las citas | 10 de 22 |
| Marca #2 | 12% | 12 de 22 |
| Marca #3 | 10% | 7 de 22 |
| El cliente del experimento | 0% como fuente · mencionado en 1% de las fuentes de terceros | 0 |
Así se arma la bola de nieve: el playbook del mercado es publicar tu propio listicle “best X companies” poniéndote primero y completando la lista con las marcas que la IA ya cita (para que la nota parezca neutral y matchee lo que el motor espera encontrar). AIO levanta ese listicle como fuente → te recomienda → el próximo que escribe un listicle te incluye porque “ya te cita la IA” → más fuentes te mencionan → más recomendaciones. La fuente individual más usada de todo el set es exactamente eso: el self-listicle de un proveedor, citado como fuente en 11 de los 22 prompts con AIO. Todos terminan recomendando a las mismas marcas — no porque sean las mejores, sino porque son las que el circuito ya retroalimenta.
De las fuentes citadas, cerca de un tercio eran self-listicles. AIO las sigue usando. Eso explica por qué la táctica funcionó tanto tiempo — y los puntos 2 y 5 explican por qué se está terminando.
2. ChatGPT: gana la home, no el contenido
El desglose de citas de ChatGPT fue el más contraintuitivo para alguien que viene del SEO editorial:
| Tipo de página citada | ChatGPT | Claude | AI Overviews |
|---|---|---|---|
| Home del proveedor | 54% | 11% | 4% |
| Landing de servicio | 28% | 20% | 30% |
| Blog post | 2% | 27% | 19% |
| Listicle | 5% | 37% | 34% |
| Otras (reviews, foros, etc.) | 12% | 5% | 14% |
ChatGPT premia el exact-match lexical entre la página comercial y la categoría que el buyer pregunta. Al extremo: los proveedores más citados tienen la keyword en el propio nombre de dominio — si el prompt es “nearshore finance and accounting”, el dominio citado es del tipo nearshorefinance[.]com. El nombre del sitio ES la categoría. Son boutiques reales, no sitios programáticos — lo verifiqué fuente por fuente.
Y el detalle que explica el ranking que ves en la respuesta: el reasoning. En su cadena de razonamiento ChatGPT registra explícitamente el sesgo de los self-listicles (“this list may be biased” sobre una nota best-X publicada por el propio proveedor) — y no lo verbaliza en la respuesta final: lo ejecuta. En vez de reproducir el típico listicle autopromocionado que rankea en Google, responde con las marcas que los third parties validan. El filtro anti-autopromoción ya está operativo dentro del motor, aunque la SERP clásica todavía lo premie.
3. Claude: la especialización le gana a la frecuencia
Claude es el espejo invertido de ChatGPT: 64% de sus citas son editorial (27% blog posts + 37% listicles). Y acá está el resultado que valida un año de trabajo: para este cliente veníamos ejecutando una estrategia de contenido deliberada — potenciar su especialización en nearshore staffing para el vertical de finanzas y accounting, con profundidad editorial por sub-nicho en lugar de contenido genérico de volumen.
El resultado medido: Claude lo recomienda y linkea en el 55% de los prompts de su sub-especialidad F&A (0% en los prompts genéricos de staffing), reproduciendo frases textuales de su contenido editorial. Todo eso apareciendo en apenas el 1% de las fuentes del ecosistema — contra marcas que están en el 10-16% de las fuentes. Claude no cuenta apariciones: evalúa si la fuente es LA especialista en la pregunta puntual. Se puede posicionar sin ser fuente masiva, si la especialización es real y está escrita.
El otro comportamiento distintivo: Claude usa listicles pero te avisa. En la interfaz de claude.ai la respuesta incluye la aclaración explícita de que la mayoría de esos listados “top 10” los publican los propios proveedores autodenominándose los mejores — y recién después menciona los nombres que se repiten de forma consistente entre fuentes. El sesgo del self-listicle ya está internalizado en los dos modelos grandes; lo administran distinto: ChatGPT lo filtra en silencio (lo suprime del set de citas), Claude lo usa y lo declara.
4. Plataformas de reviews: solo Clutch (y esto es vertical-dependiente)
Si estás invirtiendo en presencia en plataformas de reviews “para la IA”, este dato te ahorra plata: en 30 prompts × 3 motores, Clutch apareció citado en 7 prompts (siempre sus páginas de categoría) y G2, Trustpilot y Glassdoor sumaron exactamente cero citas. LinkedIn apareció solo en AIO (jobs y Pulse).
La aclaración importante: las “fuentes de verdad” varían por vertical de negocio. Este experimento es B2B de servicios de staffing — y en B2B services Clutch es LA plataforma que los motores usan para verificar marcas. En SaaS probablemente el mapa sea otro (G2 pesaría distinto), y en consumer otro más. La conclusión transferible no es “invertí en Clutch”: es identificá cuál es la plataforma de verificación de TU vertical antes de invertir en cualquiera.
4b. La tabla que ordena todo: tipo de página citada × cluster de prompt
El agregado por motor esconde el hallazgo más accionable. Segmentando las 1.143 citas por cluster de prompt, el share de citas a money pages (home + landings de servicio) queda así:
| Cluster de prompt | ChatGPT | Claude | AIO |
|---|---|---|---|
| Transaccional BOFU (“hire X from…”) | 100% | 59% | 54% |
| Conversacional (MOFU research) | 89% | 10% | 35% |
| Listicle (MOFU consideración) | 67% | 13% | 30% |
| Servicio (categoría) | 88% | 44% | 30% |
Dos lecturas:
- En prompts transaccionales MOFU-BOFU, los TRES motores viran a páginas comerciales. ChatGPT directamente no cita un solo blog post en ese cluster: 85% homes + 15% landings. Para el momento de decisión del buyer, tener home y landings optimizadas para LLMs no es un nice-to-have — es donde los motores van a buscar.
- En research, los motores divergen: Claude se va 80-84% a editorial (blogs y listicles especializados), ChatGPT sigue yendo a homes (89%). El mismo prompt de research te encuentra por caminos distintos según el motor — por eso la estrategia es por motor y por etapa del funnel, no global.
5. A lo flojo lo degrada, a lo self-promote lo expulsa
En paralelo al experimento, un competidor del vertical — que venía creciendo fuerte con contenido programático escalado con IA — perdió el 41% de su tráfico estimado en 5 semanas. El spam update de fines de junio aceleró una caída que ya venía. Lo diagnóstico está en el desglose por tipología de contenido:
- Self-promote listicles: -71%, con una de cada cuatro keywords directamente expulsada del top 100.
- Contenido flojo pero neutro (calendarios, feriados, datos utilitarios): -55%, sin expulsiones — degradado, no penalizado.
La lectura: Google está separando el contenido mediocre (lo baja) del contenido con conflicto de interés estructural (lo saca). Si tu estrategia AEO depende de listicles donde te ponés primero, tenés fecha de vencimiento en los dos frentes: los motores los suprimen y Google los expulsa.
6. El loop cerrado: el primer lead con atribución a un asistente de IA
La parte que convierte esto en algo más que un ejercicio de visibilidad: en la medición mensual de leads apareció por primera vez un lead con atribución dura en GA4 a claude.ai como fuente — aterrizando exactamente en el cluster editorial que Claude más cita en el experimento. Una muestra de uno, no una tendencia. Pero es la primera vez que el circuito completo (contenido especializado → citado por el motor → visita → lead) queda trazado de punta a punta con datos y no con fe.
Contexto que acompaña: las búsquedas de marca del cliente en su mercado objetivo crecieron 3,7x año contra año, y en los meses sin inversión paga la entrada por marca explicó entre el 43% y el 86% de los leads orgánicos. La visibilidad en motores generativos no reemplaza al SEO: lo alimenta por el costado de la marca.
7. Implicancias: una estrategia por motor
| Motor | Qué premia | Frente de trabajo |
|---|---|---|
| ChatGPT | Exact-match lexical, homes y landings | Home y landings alineadas semánticamente con la categoría |
| Claude | Especialización editorial | Contenido profundo por sub-vertical, aunque el dominio sea chico |
| AI Overviews | Presencia en las fuentes que ya cita | Digital PR sobre la target list de fuentes + Clutch |
Y el anti-playbook, con datos: no invertir en G2/Trustpilot/Glassdoor por AEO, y no construir sobre self-listicles.
8. Gotchas técnicos
- Las responses de los endpoints LLM vienen anidadas (
items → message → sections → text + annotations) — un parse ingenuo devuelve null y te hace creer que el motor no respondió. - Cache por prompt × motor es obligatorio: sin cache, cada iteración del análisis re-paga la corrida entera.
- El fetch de fuentes necesita fallback (trafilatura + bs4): un tercio de los sitios citados por AIO tienen HTML hostil.
Cierre
30 prompts, un vertical, una corrida mensual de ~6 dólares. No es un estudio académico y el disclaimer es honesto: señal temprana, muestra chica, un solo vertical B2B. Pero los patrones de retrieval son tan distintos entre motores que la conclusión operativa no necesita más muestra: medí en qué motor está tu buyer, y optimizá para la mecánica de ese motor. Lo demás es astrología con branding de AEO.
Si estás corriendo experimentos parecidos, contame qué patrones estás viendo — especialmente si tenés datos de otros verticales.