🧠 LLM Training Data Pipeline (Scraper & Tokenizer)

Dieser Prototyp zeigt, wie KI-Unternehmen rohe Daten aus dem Netz ziehen, den HTML-Müll herausfiltern und den Text in mathematische Tokens zerlegen.

Schritt 1

🌐 Roher Scraper-Input (HTML & Code)

Das hat der Bot ungefragt von einer Webseite oder einem öffentlichen GitHub-Repo heruntergeladen:

Schritt 2

🧹 HTML-Stripping & Filterung (Sanitization)

Werbung, HTML-Tags, Spam-Wörter und nutzlose Footer werden vollautomatisch herausgefiltert. Nur die "Essenz" bleibt für das KI-Training übrig:

Warte auf Pipeline-Start...
Schritt 3 & 4

🔢 KI-Tokenisierung (Byte-Pair Encoding Simulation)

Die KI kann keinen Text lesen. Das Modell zerhackt den sauberen Text in Silben/Wortteile (Tokens) und weist jedem Token eine eindeutige **ID (Zahl)** zu. Das ist das Futter für das neuronale Netz!

Visuelle Token-Trennung (BPE):

...

Numerischer Tensor (Input für das LLM-Training):

...