Custom AI agent z RAG (Retrieval-Augmented Generation) to obecnie ulubione narzedzie polskich MSP w 2026. Zamiast generic ChatGPT – masz AI ktore zna Twoja domene, Twoja FAQ, Twoja oferte. Odpowiada z kontekstu Twojej bazy wiedzy. Ten przewodnik pokazuje pelen setup w n8n + vector DB + OpenAI.

Po co Custom AI agent? Real examples
- Support bot: klient pyta „Czy moge zwrocic produkt po 14 dniach?” – AI agent odpowiada zgodnie z Twoim regulaminem, nie generic
- Sales assistant: lead pyta „Ile kosztuje wdrozenie KSeF?” – AI agent zna Twoje cennik + uslugi
- Onboarding asystent: nowy klient pyta „Jak skonfigurowac API token?” – AI agent zna Twoja dokumentacje
- Knowledge base search: pracownik pyta „Co to jest GTU 07?” – AI agent przeszukuje wewnetrzne docs

Architektura: jak dziala RAG
RAG (Retrieval-Augmented Generation) to 3-step proces:
- 1. Embeddings: Twoje docs (FAQ, regulamin, oferty) sa zamieniane na vectory matematyczne przez OpenAI embeddings model
- 2. Storage: vectory przechowywane w vector database (Pinecone, Qdrant, Supabase pgvector)
- 3. Query: gdy uzytkownik pyta, jego pytanie tez jest embedded, vector DB szuka najblizszego matchu, GPT-5 odpowiada z tym kontekstem

Setup krok po kroku – n8n + Supabase pgvector + GPT-5
Krok 1: Konto Supabase + pgvector
Rejestracja: supabase.com, Free plan (500MB Postgres + 1GB file storage gratis na zawsze). Stworz projekt, w SQL Editor uruchom: CREATE EXTENSION IF NOT EXISTS vector;. Stworz tabela: CREATE TABLE docs (id bigserial PRIMARY KEY, content text, metadata jsonb, embedding vector(1536));
Krok 2: Klucz OpenAI API
Wejdz na platform.openai.com, API Keys, Create. Doladuj $5 (wystarczy na ~10 mln tokens). Klucz zaczyna sie sk-proj-…
Krok 3: n8n credential
W n8n: Settings -> Credentials -> New -> OpenAI API. Wklej klucz. Save. Plus drugie credential: PostgreSQL z Supabase connection string.
Krok 4: Workflow Ingestion – dodanie docs do bazy
Workflow A: Ingestion (raz lub przy aktualizacji docs)
- Trigger: Manual / Cron / Webhook (gdy dodajesz nowy FAQ)
- HTTP / File Read: pobierz docs (FAQ z WordPress, regulamin z Google Doc, oferty z Notion)
- Split into chunks:
Functionnode tnie tekst na 1000-token chunks z 200-token overlap - OpenAI Embeddings: dla kazdego chunk wywoluj
text-embedding-3-small($0.02 per 1M tokens) - Postgres INSERT: zapisz (content, metadata, embedding) do tabeli docs
Krok 5: Workflow Query – AI agent odpowiada
Workflow B: Query (gdy klient pyta)
- Webhook: odbieraj POST z pytaniem (z chatbot, formularz, API)
- OpenAI Embeddings: pytanie -> embedding
- Postgres SELECT:
SELECT content FROM docs ORDER BY embedding <-> '[...]' LIMIT 5;(najblizsze 5 chunks) - OpenAI Chat Completion: GPT-5 z prompt: „Odpowiedz na pytanie uzytkownika korzystajac TYLKO z ponizszego kontekstu. Jesli nie wiesz, powiedz \”nie wiem\”. Kontekst: {{ chunks }}. Pytanie: {{ question }}”
- Response: zwroc AI answer + cytowane chunks
Polish-specific tipsy

1. Embeddings dla polskiego
OpenAI text-embedding-3-small dziala dobrze dla polskiego (multilingual). Dla niche topics (KSeF, JPK, NIP) – oka. Lepszy model: text-embedding-3-large ale 6x drozszy ($0.13 per 1M).
2. Chunk size dla polskiego
Polski jest densze niz angielski (mniej tokens per znaczenie). Recommendacje: 800 tokens per chunk + 150 overlap (vs 1000+200 dla EN).
3. System prompt po polsku
GPT-5 dziala lepiej gdy system prompt + user prompt sa w tym samym jezyku. Jesli klienci pytaja po polsku – system prompt po polsku: „Jestes asystentem SYSTEMBOX. Odpowiadasz tylko na bazie kontekstu. Jesli nie znasz odpowiedzi – powiedz: nie wiem, prosze skontaktuj sie z [email protected]”
Cost optimization
- Embeddings: $0.02 per 1M tokens. 100k slow FAQ = ~150k tokens = $0.003 (jednorazowo)
- Query: average $0.001 per query (embedding pytania + GPT-5 mini odpowiedz)
- Vector DB: Supabase Free 500MB = ~150k chunks. Wystarczy dla wiekszosci MSP
- n8n hosting: 20 zl/mies VPS
Total: dla 1000 queries/mies = ~$1 (4 zl) + 20 zl VPS = ~25 zl/mies pelen AI agent.
Use case: Voicebot Bartek z RAG
Voicebot Bartek (SYSTEMBOX) uzywa RAG: docs SYSTEMBOX (cennik, FAQ, regulamin) jako baza wiedzy. Klient dzwoni: „Ile kosztuje workflow Faktura po oplaceniu z setup?” Bartek pyta RAG: 697 + 497 = 1 194 zl. Odpowiada glosem ElevenLabs.
FAQ
Czy n8n jest najlepszy dla RAG?
Dla prototypingu – tak (visual, szybki). Dla scale 1M+ queries/mies – lepsze: LangChain Python, Flowise, Voiceflow. n8n moze backend, frontend chat osobno.
Czy moge uzywac Claude zamiast GPT?
Tak. n8n ma Anthropic node. Claude 3.5 Haiku ($0.80/M tokens) tanszy niz GPT-4o ($2.50/M). Dla MSP Claude 3.5 Haiku Recommended.
Co z pamiecia konwersacji?
Trzeba dodac: zapisz historie czatu w Postgres + dolacz do system prompt przy kazdym query. n8n Memory node moze to zrobic, lub recznie przez SQL.
Chcesz custom AI agent dla swojej domeny? Voicebot Bartek to gotowe rozwiazanie z RAG + ElevenLabs + n8n.
