BM25 vs. Embeddings vs. Reranker: Search Stack im Jahr 2026

Automatische Übersetzung Dieser Artikel wurde automatisch aus der englischen Originalversion übersetzt.

Ein guter Search Stack funktioniert wie ein Trichter. Kostengünstige Methoden stellen zunächst eine breite Kandidatenmenge zusammen; teurere Methoden verfeinern später eine deutlich kleinere Menge. Probleme entstehen häufig, wenn Teams die Exact-Text-Suche durch Embeddings ersetzen, statt beide Ansätze zu kombinieren.

Beginne mit Filtern und BM25, einer leistungsfähigen Methode für Exact-Text-Ranking. Ergänze Dense Retrieval, um semantische Treffer zu finden, und führe beide Ergebnislisten mit Reciprocal Rank Fusion (RRF) oder einer ähnlichen Methode zusammen. Führe für die Shortlist ein Reranking mit einem Cross-Encoder durch. Verwende ein LLM nur für eine sehr kleine finale Menge, bei der der Qualitätsgewinn die zusätzliche Latency und die zusätzlichen Kosten rechtfertigt.

Zuletzt geprüft: 10.08.2026. Der Stack wird anhand von Recall, Ranking-Gewinn, Policy-Korrektheit, p95-Latency und Kosten auf realen Query-Slices bewertet – nicht anhand einer universell gültigen Kandidatenanzahl.

Empfohlener Stack

StufeStandardAufgabe
FilteringStrukturierte FilterTenant, Berechtigungen, Produkt, Sprache, Zeit und Verfügbarkeit durchsetzen.
Lexical RetrievalBM25Exakte Namen, IDs, Fehlercodes, juristische Begriffe und Tokens mit hoher Precision.
Dense RetrievalEmbeddingsSynonyme, Paraphrasen, unscharfe Intention und semantischen Recall.
FusionReciprocal Rank Fusion oder gewichtete Retriever-KompositionSparse- und Dense-Kandidaten zusammenführen, ohne vergleichbare Scores zu unterstellen.
RerankingCross-EncoderEine hinsichtlich der Latency begrenzte Shortlist anhand der Query-Document-Interaktion neu ordnen.
Finale PrecisionLLM-Reranker oder Answer ModelNuancierte Relevanz erst auflösen, wenn die Liste klein ist.
EvaluationRecall@k, nDCG, MRR, Click-Labels, Human-LabelsNachweisen, dass jede Stufe die vorherige verbessert.

Standards für Use Cases

ProduktoberflächeGuter StandardBegründung
Documentation SearchBM25 plus Embeddings plus Cross-EncoderExakte API-Namen und semantische Fragen sind gleichermaßen relevant.
RAG RetrievalHybrid Retrieval plus Reranker plus Citation ChecksFehlende Evidenz ist meist problematischer als eine langsame Generierung.
Product SearchLexical Filters plus Hybrid Retrieval plus Business FeaturesVerfügbarkeit, Preis, Popularität und exakte Facets sind entscheidend.
Support SearchHybrid Retrieval plus Freshness und Ticket-MetadatenSowohl ähnliche Formulierungen als auch aktuelle Policies sind relevant.
Interne Knowledge BaseBM25-Baseline, anschließend Dense Retrieval aus Query-LogsBeginne mit Messbarkeit, bevor du Model-Kosten hinzufügst.
Legal- oder Compliance-SucheLexical Baseline plus strikte Filter, anschließend vorsichtige semantische ErweiterungFalse Positives und False Negatives sind beide kostspielig.

Warum BM25 weiterhin in den Stack gehört

Embeddings finden Texte mit ähnlicher Bedeutung, ersetzen aber Exact Matching nicht zuverlässig. Fehlercodes, Funktionsnamen, Product SKUs, juristische Formulierungen und Personennamen vermitteln ihre Intention häufig durch die exakte Schreibweise. BM25 bleibt eine starke Baseline, weil es die Begriffe belohnt, die der Nutzer tatsächlich eingegeben hat.

Dense Retrieval erhöht den Recall, wenn Nutzer das exakte Vokabular nicht kennen. Die Entscheidung lautet nicht BM25 oder Embeddings. Verwende BM25 für Lexical Recall, Embeddings für Semantic Recall und Fusion, um beide zu kombinieren.

Wann ein Reranker ergänzt werden sollte

Füge einen Cross-Encoder hinzu, wenn relevante Dokumente zwar in die Kandidatenmenge gelangen, aber zu weit unten ranken. Wähle die Anzahl der Kandidaten anhand des gemessenen Recalls und der Latency; Top 50 ist ein nützliches Experiment, aber kein universell gültiger Schwellenwert.

Füge keinen LLM-Reranker vor einem Cross-Encoder hinzu, sofern die Kandidatenmenge nicht sehr klein ist. Das Relevanzurteil muss außerdem subtil genug sein, um die Kosten zu rechtfertigen. LLM-Reranking kann helfen, ist aber teurer und langsamer. Miss es im Vergleich zu einem kostengünstigeren Reranker.

Evaluationssequenz

  1. Label reale Queries über wichtige Intents, Sprachen, Berechtigungen und Fehlerkosten hinweg. Beginne klein und erweitere anschließend, bis Slices und Unsicherheit die Entscheidung ausreichend absichern.
  2. Miss BM25 allein.
  3. Ergänze Dense Retrieval und miss die Recall-Differenz.
  4. Ergänze Fusion und miss nDCG sowie Recall@k.
  5. Ergänze Cross-Encoder-Reranking und miss Precision@1 sowie nDCG.
  6. Ergänze LLM-Reranking nur, wenn es die Qualität verbessert, nachdem Kosten und Latency berücksichtigt wurden.
  7. Beobachte Production-Metriken: Zero-Result-Rate, Reformulation-Rate, Click-Through, Answer Correction, p95-Latency und Kosten.

Weiterführende Lektüre

Referenzen