Zpět do slovníku
SEO & obsah Retrieval Augmented Generation

RAG

Postup, při kterém si jazykový model před odpovědí vyhledá zdroje a odpovídá z nich, místo aby čerpal jen z toho, co se naučil při tréninku. Kvůli RAG se dá viditelnost v AI ovlivňovat obsahem.

RAG je zkratka pro Retrieval-Augmented Generation. Model si před odpovědí vyhledá relevantní zdroje a odpověď složí z nich, místo aby čerpal pouze z toho, co se naučil při tréninku. Právě kvůli tomuto postupu se dá viditelnost značky v AI odpovědích ovlivňovat obsahem, který zveřejníte dnes.

V kostce

Co to je Generování odpovědi z vyhledaných zdrojů, ne z paměti modelu
Proč na tom záleží marketingu Bez RAG by šlo ovlivnit jen to, co bylo v tréninkových datech. S RAG rozhoduje aktuální obsah a jeho dostupnost
Kdo to používá Prakticky všichni asistenti s přístupem na web: ChatGPT, Perplexity, Gemini, Claude, Copilot
Co RAG odměňuje Jasná tvrzení, která dají smysl vytržená z kontextu, a originální data
Kde se to láme Na technické dostupnosti. Co crawler nenačte, to se do odpovědi nedostane

Jak RAG funguje

Běží ve třech krocích. Nejdřív se dotaz převede do podoby, ve které se dá vyhledávat, často se přitom rozloží na několik dílčích otázek. Pak se z indexu vytáhne sada pasáží, které na ně odpovídají. Nakonec model z těchto pasáží složí odpověď a přidá odkazy na zdroje.

Vyhledává se pasáž, ne stránka

To je nejdůležitější důsledek pro obsah. Jednotkou není URL, ale odstavec nebo sekce. Dlouhý článek, který nemá žádnou část odpovídající samostatně, má malou šanci uspět, i když je tematicky relevantní. Naopak krátká pasáž s jasnou definicí se do odpovědi dostane snadno.

Dva různé crawlery, dvě různé škody

Poskytovatelé modelů používají oddělené crawlery. Jeden sbírá obsah do indexu, druhý načítá stránku až ve chvíli, kdy na ni v konkrétní odpovědi přijde řada. Zablokovat se dá každý zvlášť a následky se liší: bez indexačního crawleru se web nedostane do výběru zdrojů vůbec, bez toho druhého model nemůže ověřit aktuální znění stránky.

Model upřednostňuje to, co si umí ověřit

Tvrzení podložené číslem, datem nebo zdrojem se do odpovědi dostává častěji než obecné tvrzení. U marketingových formulací bez údajů se model nemá čeho chytit.

Z naší praxe: crawlery zablokované firewallem

Při technických auditech testujeme crawlery jazykových modelů a vyhledávačů přímo: každý dotazem na server s jeho identifikací. Část z nich běžně dostává HTTP 403, přestože je robots.txt výslovně povoluje. Blokuje je firewall na úrovni hostingu nebo CDN, tedy vrstva, kterou většina firem nikdy nekontroluje.

Typický je rozdíl mezi dvěma roboty téhož poskytovatele: crawler, který načítá stránku při živé odpovědi, projde bez problému, zatímco indexační crawler dostává 403. Prakticky to znamená, že model umí stránku otevřít, když už o ní ví, ale sám od sebe se o ní nikdy nedozví.

Z toho plyne kontrola, která patří do pravidelné údržby: projít seznam crawlerů a ověřit návratový kód přímo. Kontrola robots.txt na to nestačí, protože robots.txt může být v rozporu s blokací na úrovni firewallu.

Časté chyby

  • Předpokládat, že model čte web přímo. Čte index. Nová stránka se v odpovědi objeví až po zaindexování, ne hned po publikaci.
  • Optimalizovat celé stránky místo pasáží. RAG pracuje s úseky, ne s URL.
  • Spoléhat na robots.txt. Skutečnou dostupnost určuje server, ne soubor.
  • Vydávat obsah bez čísel. Model preferuje ověřitelná tvrzení, obecné texty přechází.

Co z toho plyne pro obsah

  1. Psát v samostatně funkčních blocích. Každá sekce má odpovídat na jednu otázku úplnou větou.
  2. Dávat odpověď hned pod nadpis. První dvě věty rozhodují, jestli se pasáž dá použít.
  3. Uvádět zdroj a datum. Ověřitelné údaje mají přednost před formulacemi.
  4. Kontrolovat dostupnost přímo. Měsíční test crawlerů patří do rutiny stejně jako kontrola dostupnosti webu.

Časté otázky

Znamená RAG, že model nelže?

Ne. Snižuje šanci, že si model věc vymyslí, protože má po ruce zdroje. Ale když jsou zdroje špatné nebo si odporují, chyba se do odpovědi přenese.

Jak dlouho trvá, než se nový obsah objeví v odpovědích?

V řádu týdnů, protože musí nejdřív projít indexací. Rychlejší bývá Bing, ze kterého čerpá část asistentů, a indexaci lze urychlit protokolem IndexNow.

Pomůže proti chybným tvrzením o značce vlastní obsah?

Ano, pokud je konzistentní a strojově čitelný. Model řeší rozpory mezi zdroji po svém, takže stejná čísla na webu, v profilech a v katalozích jsou levná pojistka.

Stačí na to schema?

Strukturovaná data pomáhají porozumění, ale RAG vyhledává v textu. Bez použitelné pasáže samotné schema nestačí.

Kde vám pomůžeme

Technickou dostupnost pro crawlery, strukturovaná data i obsah připravený na citaci řešíme jako jednu službu. Podrobnosti jsou na stránce GEO optimalizace pro AI.

Zpět na slovník pojmů