Dieser Prototyp zeigt, wie KI-Unternehmen rohe Daten aus dem Netz ziehen, den HTML-Müll herausfiltern und den Text in mathematische Tokens zerlegen.
Das hat der Bot ungefragt von einer Webseite oder einem öffentlichen GitHub-Repo heruntergeladen:
Werbung, HTML-Tags, Spam-Wörter und nutzlose Footer werden vollautomatisch herausgefiltert. Nur die "Essenz" bleibt für das KI-Training übrig:
Die KI kann keinen Text lesen. Das Modell zerhackt den sauberen Text in Silben/Wortteile (Tokens) und weist jedem Token eine eindeutige **ID (Zahl)** zu. Das ist das Futter für das neuronale Netz!