Zum Inhalt springen

Wie TYPO3-Inhalte den Weg in die KI finden

KI-Chatbots kennen oft nur das, was in ihren Trainingsdaten steckt, und erfinden bei fehlendem Wissen munter Fakten dazu. Statt eigene KI-Modelle aufwendig zu trainieren, empfiehlt Martin Helmich in seinem Vortrag auf den TYPO3 Developer Days 2026 einen pragmatischeren Weg: Retrieval-Augmented Generation, kurz RAG. Damit lassen sich vorhandene TYPO3-Inhalte zur Laufzeit in KI-Antworten einbinden, aktuell und ohne teures Nachtrainieren.

Ein eigenes KI-Modell zu trainieren klingt einfacher, als es ist. Frontier-Modelle zu entwickeln, ist ohne Millionenbudget kaum realistisch. Auch das Feinabstimmen bestehender Modelle auf eigene Inhalte birgt Tücken: Martin berichtete von einem internen Experiment, bei dem ein auf Support-Tickets trainiertes Modell munter erfundene Antworten produzierte, ein klassischer Fall von Overfitting. Hinzu kommen laufende Kosten für Training und Infrastruktur.

Die deutlich praktikablere Alternative heißt Retrieval-Augmented Generation. Dabei werden relevante Inhalte zur Anfragezeit aus einer Datenbank geholt und dem Sprachmodell als zusätzlicher Kontext mitgegeben. Grundlage dafür sind Embeddings: Inhalte werden in hochdimensionale Vektoren umgewandelt, die ihre Bedeutung erfassen. So findet eine Suche auch dann passende Treffer, wenn Nutzer nicht die exakten Begriffe verwenden.

Für TYPO3 zeigte Helmich, wie sich das Solr-Extension (ab Version 14) mit Vektorsuche kombinieren lässt. Solr übernimmt dabei automatisch das Erzeugen der Embeddings, inklusive Rechteverwaltung und Mehrsprachigkeit. Als Alternative stellte er das SEAL-Projekt vor, das auf Symfony AI aufbaut.

Für die Chat-Oberfläche zeigte Martin zwei Wege: eine schnelle Lösung mit dem Orchestrierungs-Tool n8n sowie eine selbst gebaute Variante mit Symfony AI, bei der ein Such- und ein Re-Ranking-Schritt die Qualität der Ergebnisse verbessern. Re-Ranking sorgt dafür, dass wirklich relevante Inhalte oben landen, statt nur oberflächlich passende Treffer.

Abschließend riet Martin, die Qualität solcher Systeme regelmäßig zu prüfen, etwa mit vordefinierten Referenzantworten oder durch LLM-as-a-Judge-Verfahren, bei denen ein KI-Modell die Antworten eines anderen bewertet.

Martin Helmich beim Vortrag auf den TYPO3 Developer Days 2026

Martin Helmich