RAG
RAG je zkratka pro Retrieval-Augmented Generation. Model si před odpovědí vyhledá relevantní zdroje a odpověď složí z nich, místo aby čerpal pouze z toho, co se naučil při tréninku. Právě kvůli tomuto postupu se dá viditelnost značky v AI odpovědích ovlivňovat obsahem, který zveřejníte dnes.
V kostce
| Co to je | Generování odpovědi z vyhledaných zdrojů, ne z paměti modelu |
| Proč na tom záleží marketingu | Bez RAG by šlo ovlivnit jen to, co bylo v tréninkových datech. S RAG rozhoduje aktuální obsah a jeho dostupnost |
| Kdo to používá | Prakticky všichni asistenti s přístupem na web: ChatGPT, Perplexity, Gemini, Claude, Copilot |
| Co RAG odměňuje | Jasná tvrzení, která dají smysl vytržená z kontextu, a originální data |
| Kde se to láme | Na technické dostupnosti. Co crawler nenačte, to se do odpovědi nedostane |
Jak RAG funguje
Běží ve třech krocích. Nejdřív se dotaz převede do podoby, ve které se dá vyhledávat, často se přitom rozloží na několik dílčích otázek. Pak se z indexu vytáhne sada pasáží, které na ně odpovídají. Nakonec model z těchto pasáží složí odpověď a přidá odkazy na zdroje.
Vyhledává se pasáž, ne stránka
To je nejdůležitější důsledek pro obsah. Jednotkou není URL, ale odstavec nebo sekce. Dlouhý článek, který nemá žádnou část odpovídající samostatně, má malou šanci uspět, i když je tematicky relevantní. Naopak krátká pasáž s jasnou definicí se do odpovědi dostane snadno.
Dva různé crawlery, dvě různé škody
Poskytovatelé modelů používají oddělené crawlery. Jeden sbírá obsah do indexu, druhý načítá stránku až ve chvíli, kdy na ni v konkrétní odpovědi přijde řada. Zablokovat se dá každý zvlášť a následky se liší: bez indexačního crawleru se web nedostane do výběru zdrojů vůbec, bez toho druhého model nemůže ověřit aktuální znění stránky.
Model upřednostňuje to, co si umí ověřit
Tvrzení podložené číslem, datem nebo zdrojem se do odpovědi dostává častěji než obecné tvrzení. U marketingových formulací bez údajů se model nemá čeho chytit.
Z naší praxe: crawlery zablokované firewallem
Při technických auditech testujeme crawlery jazykových modelů a vyhledávačů přímo: každý dotazem na server s jeho identifikací. Část z nich běžně dostává HTTP 403, přestože je robots.txt výslovně povoluje. Blokuje je firewall na úrovni hostingu nebo CDN, tedy vrstva, kterou většina firem nikdy nekontroluje.
Typický je rozdíl mezi dvěma roboty téhož poskytovatele: crawler, který načítá stránku při živé odpovědi, projde bez problému, zatímco indexační crawler dostává 403. Prakticky to znamená, že model umí stránku otevřít, když už o ní ví, ale sám od sebe se o ní nikdy nedozví.
Z toho plyne kontrola, která patří do pravidelné údržby: projít seznam crawlerů a ověřit návratový kód přímo. Kontrola robots.txt na to nestačí, protože robots.txt může být v rozporu s blokací na úrovni firewallu.
Časté chyby
- Předpokládat, že model čte web přímo. Čte index. Nová stránka se v odpovědi objeví až po zaindexování, ne hned po publikaci.
- Optimalizovat celé stránky místo pasáží. RAG pracuje s úseky, ne s URL.
- Spoléhat na robots.txt. Skutečnou dostupnost určuje server, ne soubor.
- Vydávat obsah bez čísel. Model preferuje ověřitelná tvrzení, obecné texty přechází.
Co z toho plyne pro obsah
- Psát v samostatně funkčních blocích. Každá sekce má odpovídat na jednu otázku úplnou větou.
- Dávat odpověď hned pod nadpis. První dvě věty rozhodují, jestli se pasáž dá použít.
- Uvádět zdroj a datum. Ověřitelné údaje mají přednost před formulacemi.
- Kontrolovat dostupnost přímo. Měsíční test crawlerů patří do rutiny stejně jako kontrola dostupnosti webu.
Časté otázky
Znamená RAG, že model nelže?
Ne. Snižuje šanci, že si model věc vymyslí, protože má po ruce zdroje. Ale když jsou zdroje špatné nebo si odporují, chyba se do odpovědi přenese.
Jak dlouho trvá, než se nový obsah objeví v odpovědích?
V řádu týdnů, protože musí nejdřív projít indexací. Rychlejší bývá Bing, ze kterého čerpá část asistentů, a indexaci lze urychlit protokolem IndexNow.
Pomůže proti chybným tvrzením o značce vlastní obsah?
Ano, pokud je konzistentní a strojově čitelný. Model řeší rozpory mezi zdroji po svém, takže stejná čísla na webu, v profilech a v katalozích jsou levná pojistka.
Stačí na to schema?
Strukturovaná data pomáhají porozumění, ale RAG vyhledává v textu. Bez použitelné pasáže samotné schema nestačí.
Kde vám pomůžeme
Technickou dostupnost pro crawlery, strukturovaná data i obsah připravený na citaci řešíme jako jednu službu. Podrobnosti jsou na stránce GEO optimalizace pro AI.