To jest przykładowe case study pokazujące format. Podmień treść na realny projekt.
Problem
Zespół wsparcia szukał odpowiedzi w ok. 4 tys. dokumentów (PDF, Confluence, procedury). Średni czas znalezienia właściwej informacji wynosił kilkanaście minut, a nowi pracownicy potrzebowali miesięcy, żeby się odnaleźć.
Decyzje
- Hybrid search (BM25 + embeddingi w pgvector) i re-ranking — czyste wyszukiwanie wektorowe gubiło nazwy własne i numery procedur.
- Każda odpowiedź cytuje źródła z linkiem do fragmentu dokumentu.
- Router modeli: proste pytania obsługuje tańszy model, złożone — mocniejszy. Semantic cache dla powtarzalnych pytań.
- Zestaw 200 pytań testowych i ewaluacja RAGAS uruchamiana przy każdej zmianie promptu lub indeksu.
Wynik
- Faithfulness 0,87 na zestawie testowym.
- Koszt LLM -62% względem jednego dużego modelu do wszystkiego.
- p95 czasu odpowiedzi poniżej 2 sekund.