Según W3Techs, la firma que mide el uso de tecnologías web a nivel mundial, a mediados de 2026 el 49,7 por ciento de los sitios web con idioma identificable estaban escritos en inglés, frente a un 6,0 por ciento en español, que ocupa el segundo lugar junto al alemán. Esa proporción no es casualidad, es la base de datos con la que se entrenan la mayoría de los modelos de Inteligencia Artificial.
Por qué el idioma del contenido importa para que te citen
Los grandes modelos de lenguaje aprenden a partir de enormes volúmenes de texto extraídos de internet, en su mayoría del proyecto Common Crawl. Una revisión académica de 2024 sobre los corpus usados para entrenar modelos de lenguaje señaló que el inglés representa entre el 44 y el 46 por ciento del contenido de esos volcados, muy por delante de cualquier otro idioma individual, incluido el español.
Cuanto más contenido hay en un idioma dentro de los datos de entrenamiento, más fácil es para el modelo encontrar, comprender y citar información en ese idioma con precisión.
Qué pasa en el momento en que el modelo responde y cita fuentes
El estudio de la empresa Profound sobre 680 millones de citas reales, publicado en junio de 2025 y actualizado en agosto de ese mismo año, encontró que el 80,41 por ciento de las citas de ChatGPT proceden de dominios .com y otro 11,29 por ciento de dominios .org. Los dominios nacionales, como .uk, .au, .br o .ca, sumados entre todos representan apenas un 3,5 por ciento. La tendencia del motor es clara: prioriza dominios genéricos, que en la práctica funcionan mayoritariamente en inglés.
Entonces, hay que escribir en inglés para que te citen
No necesariamente, y depende de qué preguntan tus clientes potenciales. Si alguien en España o en Latinoamérica le pregunta a una Inteligencia Artificial por un profesional de tu sector en su propio idioma, el modelo va a intentar responder con fuentes en español si las encuentra, porque responde en el idioma en que se le pregunta y busca coherencia lingüística siempre que existan fuentes suficientes.
El problema no es que el español esté prohibido para el modelo. El problema es que hay menos contenido de calidad en español compitiendo por ese espacio, así que quien sí publica en español con autoridad tiene más probabilidad relativa de destacar dentro de ese conjunto más pequeño.
Lo que sí cambia el resultado
Publicar contenido en español con datos concretos, nombres propios y fechas verificables compite en un terreno menos saturado que el inglés. La escasez relativa de contenido hispanohablante de calidad es, paradójicamente, una oportunidad para quien sí lo produce con cuidado.
El riesgo de escribir solo para el buscador y no para el hablante
Traducir contenido al inglés de forma automática y sin cuidado, solo para intentar aparecer más, suele producir textos genéricos que ni el lector humano ni el modelo terminan citando con confianza. La autoridad se construye escribiendo bien en el idioma de quien realmente te va a contratar, no persiguiendo el idioma que estadísticamente domina la web.
¿Qué puedes hacer tú con esto?
Si tu negocio y tus clientes son hispanohablantes, escribe y publica en español con datos concretos y verificables. Es el idioma en el que te van a preguntar, y donde menos competencia real de calidad hay compitiendo por ese espacio.
Comprueba con RADAR en qué idioma te está citando hoy la Inteligencia Artificial
Sobre el autor
Javier G. Amblar es consultor estratégico con 27 años de experiencia y más de 33.000 profesionales formados en 55 países. Exprofesor asociado del IE Business School, dirige un canal de YouTube con más de 368.000 suscriptores y una comunidad en línea de más de 500.000 personas. Ha colaborado con RTVE, Telemadrid, Onda Cero y EsRadio. Creó RADAR para que sepas qué dice de ti la Inteligencia Artificial.


