RAG (retrieval-augmented generation) je spôsob, akým dnes odpovedá ChatGPT pri vyhľadávaní, Perplexity aj Google AI Overviews: model najprv vyhľadá zdroje a až potom z nich napíše odpoveď. Ak chcete, aby vás AI citovala, musíte byť medzi tými nájdenými zdrojmi a vaša pasáž musí byť tá, ktorú model použije. Všetko ostatné, čo sa okolo GEO a AEO predáva, je nadstavba nad týmto jednoduchým princípom.
RAG nie je marketingový pojem. Je to technický postup z výskumu umelej inteligencie a keď mu rozumiete, prestanete veriť sľubom typu „dostaneme vás do ChatGPT za mesiac“.
Stručne
- RAG spája dve veci: vyhľadávanie (retrieval) a generovanie textu (generation).
- Pojem pochádza z výskumnej práce Lewis et al. z roku 2020.
- AI vyhľadávače necitujú celé stránky, ale vybrané pasáže.
- Zdroje sa vyberajú z indexov vyhľadávačov, takže klasické SEO je vstupná brána.
- Tréning a vyhľadávanie robia rôzne roboty. Kto zablokuje nesprávneho, môže z AI odpovedí vypadnúť.
Čo je RAG a odkiaľ sa vzal
Jazykový model sám osebe vie len to, čo sa naučil pri tréningu. Tieto znalosti majú dátum, môžu byť nepresné a model si ich pri otázke nevie overiť. Výsledkom sú halucinácie: model s istotou napíše niečo, čo nie je pravda.
V roku 2020 výskumníci z Facebook AI Research opísali v práci Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks riešenie: model pred odpoveďou vyhľadá v databáze dokumentov relevantné texty a odpoveď stavia na nich. Odvtedy je RAG štandard všade, kde AI odpovedá na otázky o aktuálnom svete, od firemných chatbotov po AI vyhľadávače.
Ako RAG funguje v AI vyhľadávaní krok za krokom
- Pochopenie otázky. Model zistí, na čo sa pýtate, a pri zložitejších otázkach si ju rozloží na podotázky. Google tomu hovorí query fan-out.
- Vyhľadanie (retrieval). Podotázky idú do indexu. Google používa vlastný index a svoje hodnotiace systémy, ChatGPT pri vyhľadávaní čerpá z externých indexov a vlastného crawlovania, Perplexity má vlastný index.
- Rozsekanie na pasáže (chunking). Nájdené stránky sa rozdelia na menšie kusy textu, zvyčajne podľa nadpisov a odsekov.
- Výber a preradenie (reranking). Systém vyberie pasáže, ktoré na podotázku odpovedajú najlepšie. Tu sa rozhoduje o vašej citácii.
- Generovanie. Model napíše odpoveď z vybraných pasáží a pri niektorých pridá odkaz na zdroj.
Dôležité je, že krok 2 je v podstate klasické vyhľadávanie. Ak vás vyhľadávač nenájde, nič z ďalších krokov sa nestane. Preto hovorím, že GEO optimalizácia bez SEO je predávanie vzduchu.
Čo z toho vyplýva pre SEO
Súťažíte pasážou, nie stránkou
V klasickom Google ste súťažili celou stránkou. V RAG súťaží odsek. Stránka môže byť na prvej pozícii, ale ak má odpoveď na otázku „koľko to stojí“ schovanú v treťom odseku za dvoma vetami o tom, aké je SEO dôležité, AI si vezme pasáž od niekoho, kto cenu napísal hneď. Každá sekcia článku má preto začínať odpoveďou na otázku z nadpisu.
Štruktúra pomáha rozsekaniu
Systémy delia text podľa nadpisov, odsekov, zoznamov a tabuliek. Logická štruktúra H2 a H3, krátke odseky a tabuľky s porovnaním sa rozsekajú tak, že každý kúsok dáva zmysel aj samostatne. Jeden dlhý blok textu sa rozseká náhodne a pasáž bez kontextu nikto necituje.
Unikátna informácia má väčšiu šancu
Ak päť zdrojov hovorí to isté, modelu stačí jeden. Ak váš text obsahuje číslo, postup alebo skúsenosť, ktorú ostatné nemajú, je pre odpoveď nenahraditeľný. O tom je information gain.
AI roboty musia mať prístup
Toto je najčastejšia chyba, ktorú nachádzam pri auditoch. Firma si v robots.txt alebo cez Cloudflare zablokuje „AI roboty“, lebo nechce, aby sa na jej obsahu trénovalo, a omylom zablokuje aj roboty, ktoré obsah načítavajú pre vyhľadávanie. OpenAI napríklad rozlišuje GPTBot na tréning a OAI-SearchBot a ChatGPT-User na vyhľadávanie. Ako to skontrolovať, popisujem v článku technické SEO pre AI.
| Krok RAG | Čo rozhoduje | Čo môžete ovplyvniť |
|---|---|---|
| Vyhľadanie | indexácia, relevancia, autorita | technické SEO, obsah na tému, odkazy, entita |
| Rozsekanie | štruktúra textu | nadpisy, krátke odseky, tabuľky, zoznamy |
| Výber pasáže | presnosť odpovede na podotázku | odpoveď v prvej vete, konkrétne čísla |
| Generovanie a citácia | dôveryhodnosť a unikátnosť zdroja | vlastné dáta, autor, E-E-A-T |
Dve cesty do odpovede AI: tréning a RAG
Do odpovede AI sa viete dostať dvoma spôsobmi a je dobré ich nemiešať.
Prvá cesta je tréning. Ak o vás na internete roky existuje veľa konzistentných informácií, model si časť z nich „zapamätá“. Preto ChatGPT pozná veľké značky aj bez vyhľadávania. Tento kanál ovplyvňujete pomaly a nepriamo: zmienkami, recenziami, rozhovormi, Wikipédiou, YouTube. Výsledok uvidíte až pri ďalšej verzii modelu.
Druhá cesta je RAG. Tu rozhoduje to, čo model nájde v čase otázky. Tento kanál sa dá ovplyvniť rýchlejšie, lebo stačí, aby váš web bol dostupný, mal dobrú pasáž na podotázku a bol v indexe dobre hodnotený. Nový článok sa môže v odpovediach AI objaviť do pár týždňov, ak ho vyhľadávač zaradí medzi relevantné výsledky.
V praxi to znamená, že malá firma nemá šancu dostať sa do „pamäti“ modelu tak rýchlo ako globálna značka, ale cez RAG s ňou vie súťažiť v konkrétnych otázkach. A práve to je priestor pre slovenské firmy, kde je konkurencia v obsahu stále slabá.
Prečo AI klame aj s RAG
RAG halucinácie znižuje, ale neodstraňuje. Model môže vybrať zlú pasáž, spojiť dve pasáže z rôznych webov do nesprávneho záveru alebo citovať zdroj, ktorý tvrdí niečo iné. Videl som AI odpovede, kde bola cena z jedného webu a podmienky z druhého, a výsledok neplatil ani pre jeden.
Pre vás to má dva dôsledky. Po prvé, píšte jednoznačne: cena, rozsah, pre koho, v jednej vete, aby sa nedala vytrhnúť z kontextu. Po druhé, kontrolujte, čo o vás AI hovorí. Ak sa opakovane objavuje nesprávna informácia, zvyčajne má zdroj, a ten sa dá nájsť a opraviť. Prečo AI o firmách hovorí to, čo hovorí, a kde sa berú zdroje, rozoberám v článku o zmienkach o značke v AI.
Príklad z praxe: access log ukáže pravdu
Pri každom klientovi, ktorý rieši viditeľnosť v AI, sa najprv pozriem do access logu. Je to súbor, ktorý má každý web zadarmo, a ukáže, či na web reálne chodia OAI-SearchBot, ChatGPT-User, PerplexityBot či ClaudeBot a aký kód im server vracia.
Na wooacademy.sk sledujem návštevy z AI zvlášť v GA4. Viac o meraní píšem v článku aké máte výsledky z ChatGPT.
Čo spraviť, aby vás RAG systémy vyberali
- Overte prístup robotov: robots.txt, firewall, Cloudflare a access log.
- Majte obsah v HTML: dôležitý text nesmie byť len v JavaScripte, ktorý robot nevykreslí.
- Píšte pasážovo: každá sekcia začína odpoveďou, potom vysvetlenie a dôkaz.
- Používajte tabuľky a zoznamy na porovnania, ceny a postupy.
- Pridajte vlastné dáta a podpíšte ich menom autora.
- Robte klasické SEO, lebo vyhľadanie je prvý krok RAG a bez neho sa do odpovede nedostanete.
- Budujte zmienky mimo webu. Viac v článku o zmienkach o značke v AI.
Potrebujete vedieť, prečo vás AI necituje?
Na AI SEO konzultácii alebo bežnej SEO konzultácii (350 € za hodinu) prejdem váš access log, robots.txt a obsah a ukážem vám, v ktorom kroku RAG vypadávate. Ak chcete kompletný plán na rok, je tu komplexná AI SEO stratégia. A ak to nechcete riešiť sami, pozrite si SEO služby, kde je GEO súčasťou každej spolupráce.
Článok napísal RNDr. Milan Fraňo, PhD., SEO špecialista a HEAD of SEO vo WooAcademy. Ako vedec čítam pôvodné výskumné práce, nie len ich zhrnutia na LinkedIne.
Časté otázky
Čo je RAG?
RAG (retrieval-augmented generation) je postup, pri ktorom jazykový model pred odpoveďou vyhľadá relevantné dokumenty a odpoveď napíše na ich základe. Používajú ho ChatGPT pri vyhľadávaní, Perplexity aj Google AI Overviews a AI Mode.
Aký je rozdiel medzi tréningovými dátami a RAG?
Tréningové dáta sú to, čo si model „pamätá“ z učenia, a môžu byť staré. RAG dopĺňa aktuálne zdroje z webu v čase otázky. Pri RAG sa dá zdroj ovplyvniť, pri tréningu len veľmi nepriamo.
Ak zablokujem GPTBot, zmiznem z ChatGPT?
Nie nevyhnutne. GPTBot zbiera dáta na tréning, vyhľadávanie v ChatGPT používa iné roboty (OAI-SearchBot a ChatGPT-User). Pred blokovaním si preto v robots.txt overte, ktorý robot čo robí.
Dá sa optimalizovať obsah pre RAG?
Áno: technická dostupnosť pre AI roboty, odseky, ktoré odpovedajú samostatne, jasné nadpisy, vlastné dáta a dobré pozície v klasickom vyhľadávaní, z ktorého RAG zdroje vyberá.
Prečo ma AI necituje, keď som v Google na prvej strane?
RAG necituje stránky, ale pasáže. Ak vaša stránka na konkrétnu podotázku neodpovedá jasným odsekom, AI si vezme pasáž od konkurencie, aj keď je v klasických výsledkoch nižšie.
