Wdrożenia AI · Przykład

Asystent AI na dokumentacji firmy

RAG z wyszukiwaniem hybrydowym i re-rankingiem na tysiącach dokumentów. Ewaluacja RAGAS, routing modeli pod kątem kosztu.

Klient
Firma usługowa B2B (przykład)
Rok
2026
Zakres
PoCRAGEwaluacjaFinOps
Stack
PythonFastAPIpgvectorClaudeOllama
Wdrożenia AI
0.87faithfulness
-62%koszt LLM
<2 sp95 odpowiedzi

Architektura referencyjna

ORCHESTRATIONMODELE I WIEDZAUżytkownikczat · API · agentAPIauth · rate limitLLM routerkoszt ↔ jakośćRetrieverhybrid + rerankModeleClaude · OllamaSemantic cacheRedispgvectorembeddingiŹródła wiedzyPDF · Confluence · DBDWG · AI-01 · nightdev
  1. Użytkownikczat · API · agent
  2. APIauth · rate limit
  3. LLM routerkoszt ↔ jakośćRetrieverhybrid + rerank
  4. ModeleClaude · OllamaSemantic cacheRedispgvectorembeddingiŹródła wiedzyPDF · Confluence · DB
Architektura referencyjna · Asystent AI na dokumentacji firmy

To jest przykładowe case study pokazujące format. Podmień treść na realny projekt.

Problem

Zespół wsparcia szukał odpowiedzi w ok. 4 tys. dokumentów (PDF, Confluence, procedury). Średni czas znalezienia właściwej informacji wynosił kilkanaście minut, a nowi pracownicy potrzebowali miesięcy, żeby się odnaleźć.

Decyzje

  • Hybrid search (BM25 + embeddingi w pgvector) i re-ranking — czyste wyszukiwanie wektorowe gubiło nazwy własne i numery procedur.
  • Każda odpowiedź cytuje źródła z linkiem do fragmentu dokumentu.
  • Router modeli: proste pytania obsługuje tańszy model, złożone — mocniejszy. Semantic cache dla powtarzalnych pytań.
  • Zestaw 200 pytań testowych i ewaluacja RAGAS uruchamiana przy każdej zmianie promptu lub indeksu.

Wynik

  • Faithfulness 0,87 na zestawie testowym.
  • Koszt LLM -62% względem jednego dużego modelu do wszystkiego.
  • p95 czasu odpowiedzi poniżej 2 sekund.

Masz projekt, który musi działać szybko i na dużą skalę?

Opisz go w 2 minuty. Odpowiem w ciągu 24 godzin z pierwszymi wnioskami i propozycją kolejnego kroku.