Zum Inhalt springen

Cómo llegan los contenidos de TYPO3 a la IA

Los chatbots de IA a menudo solo conocen lo que contienen sus datos de entrenamiento y, cuando les falta información, se inventan datos al respecto sin pensárselo dos veces. En lugar de dedicar mucho tiempo a entrenar modelos propios de IA, Martin Helmich recomienda en su ponencia en los TYPO3 Developer Days 2026 un enfoque más pragmático: la «Retrieval-Augmented Generation», o RAG, por sus siglas en inglés. Esta técnica permite integrar contenidos existentes de TYPO3 en las respuestas de la IA en tiempo de ejecución, de forma actualizada y sin necesidad de un costoso entrenamiento adicional.

Entrenar un modelo de IA propio parece más fácil de lo que es. Desarrollar modelos de vanguardia es poco realista sin un presupuesto millonario. Además, ajustar los modelos existentes a los contenidos propios también presenta dificultades: Martin contó un experimento interno en el que un modelo entrenado con tickets de asistencia técnica generaba respuestas inventadas, un caso clásico de sobreajuste. A esto hay que añadir los costes recurrentes de entrenamiento e infraestructura.

La alternativa, mucho más viable, se denomina «generación aumentada por recuperación» (Retrieval-Augmented Generation). En este proceso, en el momento de la consulta se extraen contenidos relevantes de una base de datos y se proporcionan al modelo de lenguaje como contexto adicional. La base de este enfoque son las representaciones (embeddings): los contenidos se transforman en vectores de alta dimensión que captan su significado. De este modo, una búsqueda encuentra resultados adecuados incluso cuando los usuarios no utilizan los términos exactos.

En el caso de TYPO3, Helmich mostró cómo se puede combinar la extensión Solr (a partir de la versión 14) con la búsqueda vectorial. Solr se encarga automáticamente de generar las representaciones, incluida la gestión de derechos y el multilingüismo. Como alternativa, presentó el proyecto SEAL, basado en Symfony AI.

En cuanto a la interfaz de chat, Martin mostró dos opciones: una solución rápida con la herramienta de orquestación n8n y una variante desarrollada por él mismo con Symfony AI, en la que un paso de búsqueda y otro de reordenación mejoran la calidad de los resultados. La reclasificación garantiza que los contenidos realmente relevantes aparezcan en los primeros puestos, en lugar de resultados que solo coincidan de forma superficial.

Para terminar, Martin aconsejó comprobar periódicamente la calidad de este tipo de sistemas, por ejemplo, con respuestas de referencia predefinidas o mediante procedimientos de «LLM-as-a-Judge», en los que un modelo de IA evalúa las respuestas de otro.

Martin Helmich durante su ponencia en los TYPO3 Developer Days 2026

Martin Helmich

El contenido de esta página se ha traducido automáticamente.