Chunk-Werkstatt · kostenlos, ohne Anmeldung

Chunks, wie Ihre Vektordatenbank sie braucht.

Eine Vektordatenbank findet nur so gut, wie die Textstücke sind, die Sie ihr geben. Hier stellen Sie ein, wie Ragfeed eine Seite teilt, und sehen sofort das Ergebnis. Wenn es passt, übernehmen Sie die Einstellung mit einem Klick als API-Aufruf.

1 · Seite

Beispiele:

2 · Ihr Embedding-Modell

Das Modell, das bei Ihnen Texte in Vektoren umwandelt. Jeder Chunk passt dann garantiert in sein Eingabefenster.

3 · Größe

Überlappung wiederholt das Ende des vorigen Stücks, wenn ein langer Abschnitt geteilt wird. Zwischen zwei Überschriften ist sie nicht nötig, und in unserer Messung brachte sie keine besseren Treffer.

4 · Vorspann im Einbettungstext

Titel und Überschrift stehen immer in den Metadaten. Vor den Text gestellt helfen sie nur, wenn viele Seiten gleichnamige Abschnitte haben. In unserer Messung unten fand die Suche ohne Vorspann gleich gut oder besser.

Weitere Einstellungen

Mit Namensraum bekommen dieselben Seiten in verschiedenen Projekten verschiedene IDs.

Klicken Sie auf „Laden“. Die Seite wird einmal abgerufen, danach sehen Sie jede Änderung sofort.

Was hier passiert, in vier Schritten

  1. Ragfeed teilt die Seite entlang ihrer Überschriften in Chunks. Menüs, Linklisten, Brotkrumen und Quellenverzeichnisse fallen weg, damit sie später nicht als falsche Treffer auftauchen.
  2. Ihr Embedding-Modell verwandelt den Einbettungstext jedes Chunks (embedText) in einen Vektor, eine lange Zahlenreihe. Ähnliche Bedeutung ergibt ähnliche Zahlen.
  3. Ihre Vektordatenbank speichert pro Chunk die ID, den Vektor, die Metadaten und den Text. Ragfeed liefert IDs und Metadaten so, dass jede gängige Datenbank sie annimmt.
  4. Bei einer Frage wird die Frage mit demselben Modell zum Vektor, die Datenbank sucht die ähnlichsten Chunks, und Ihre KI antwortet mit ihnen.

Worauf es ankommt

  • Das Modell bestimmt die Obergrenze. Was über das Eingabefenster hinausgeht, schneiden viele Modelle ohne Meldung ab. Bei Modellen mit 512 Tokens ist das schnell erreicht.
  • 500 Tokens sind ein guter Start. In unserer Messung trafen Chunks dieser Größe bei beiden Modellen am besten oder gleichauf. 250 Tokens halbieren, was Ihre KI pro Frage lesen muss, und treffen bei Modellen mit 512 Tokens fast gleich gut, bei Modellen mit großem Eingabefenster deutlich schlechter. 1.000 Tokens brachten keine besseren Treffer, aber mehr Zusammenhang pro Chunk.
  • Sauberer Text schlägt Vorspann. Ein Vorspann aus Titel und Überschriften brachte in unserer Messung keinen Vorteil. Er kann helfen, wenn Ihre Datenbank viele Seiten mit gleichnamigen Abschnitten enthält, etwa „Kosten“ bei hundert Produkten. Filtern können Sie danach immer, über die Metadaten.
  • Die Probefrage ist eine Stichwortsuche. Sie zeigt schnell, ob die Antwort in einem Chunk steckt. Ihre Vektorsuche findet zusätzlich Umschreibungen.

Alle Felder eines Chunks und die Optionen im Detail: Entwickler-Doku.

Unsere Messung mit echten Fragen

58 Fragen zu 10 echten Seiten, gemessen am 30.09.2026. Alle Chunks liegen in einem gemeinsamen Index, zusammen mit 8 weiteren Seiten zu ähnlichen Themen, wie in einer echten Datenbank.

Einstellungmultilingual-e5-large (512 Tokens)
Treffer unter den ersten 3 · Tokens der 3 Chunks
jina-embeddings-v2-base-de (8.192 Tokens)
Treffer unter den ersten 3 · Tokens der 3 Chunks
Einfach nach Länge geschnitten (1.750 Zeichen) 76 % · 1.275 86 % · 1.276
Abschnitte nach Überschriften, nur der Text eingebettet (Standard) 98 % · 871 90 % · 886
Abschnitte nach Überschriften mit Titel und Pfad 91 % · 921 84 % · 894
Abschnitte nach Überschriften mit Pfad, ohne Seitentitel 88 % · 869 90 % · 904
Profil Präzise (250 Tokens) 95 % · 499 79 % · 467
Profil Viel Zusammenhang (1.000 Tokens) 95 % · 1.418 90 % · 1.504
Ausgewogen mit 75 Tokens Überlappung 93 % · 806 91 % · 854

Methode: Jede Frage hat eine wörtliche Antwortstelle auf ihrer Seite. Eine Frage gilt als gefunden, wenn einer der drei Chunks, die die Vektorsuche als ähnlichste liefert, diese Stelle enthält. Fett ist die beste Einstellung je Modell. Die Tokens zeigen, wie viel Text Ihre KI mit den drei Chunks pro Frage lesen muss. Die Seiten wurden mit Ragfeed abgerufen, der Vergleich „einfach nach Länge“ schneidet dasselbe Markdown so, wie es viele Standard-Pipelines tun. Andere Seiten und Fragen ergeben andere Zahlen. Probieren Sie Ihre eigenen Seiten oben aus.