Blog

Poznámky ze studia

Praktické texty o stavbě konverzační AI, která opravdu běží v provozu - RAG, fine-tuning, mantinely, evaluace, orchestrace agentů a nasazení.

13. července 2026

Drahá práce nepatří na kritickou cestu odpovědi

Embeddingy, geocoding, re-indexování webu - to vše je drahé a předvídatelné. Když to děláte v requestu, platíte za to latencí na každý dotaz. Když to odsunete offline a na kritické cestě necháte jen levné indexované lookupy, odpověď držíte rychlou i na obří databázi. Princip: co se mění zřídka, se nepočítá za běhu.

Číst článek

13. července 2026

Inline markup místo tool callů: Odpověď jako jeden průtok

Každý tool call je round-trip - vymyslet výsledek, vrátit ho, nechat model pokračovat. Když věci, které by normálně volaly nástroj (návrhy na pokračování, odkazy na entity, výzvy), necháte model emitovat přímo ve streamované odpovědi jako inline značky, odpověď se stane jedním průtokem. Latence na první token klesne, protože nic nepočítáte dopředu.

Číst článek

13. července 2026

Malé úniky: co stojí latenci, když se na to zapomene

Tři sekundy na odpověď je budget, ne průměr. A budget prosvědčí spousta drobných úniků - fresh TLS handshake na každém embedu, restart agent loop po chybovém toolu, extra model-call poté, co uživatel dostal, co potřeboval. Žádný z nich sám o sobě nezmění číslo, ale dohromady rozhodnou, jestli se vejdeš do limitu.

Číst článek

13. července 2026

Prefix cache je zbraň proti latenci: Držte prompt v klidu

Nejrychlejší token je ten, který se už nachystal. Poskytovatelé cachují prefix promptu - ale jen ten, co se nemění. Každá dynamická vsuvka na začátku zruší celý ten dar. Statický system prompt a per-turn injekce až za cachovatelným prefixem jsou nejlevnější výhra na latenci, jakou najdete.

Číst článek

25. června 2026

Evaluace jako vstup, ne dashboard: Jak stavět sebeopravné LLM systémy

Většina týmů bere evaluaci jako tabuli skóre - číslo, na které mrknete a je vám dobře nebo zle. Pokročilá myšlenka je zapojit eval zpátky do systému jako vstup, který ho přepisuje: trace jdou nezávislým rozhodčím, fixy se navrhují automaticky a jeden člověk schvaluje. Je to AI až na dno, s jedinou bránou, která jí není.

Číst článek

24. června 2026

Záměr na prvním místě: Jak bot pozná, na co se vlastně ptáte

Než bot dobře odpoví, musí vědět, jakému druhu otázky čelí. Vynechte ten krok a chitchat dostane databázový dotaz, „minulý měsíc" se pošle do SQL nepřeložený a každý požadavek jede touž hloupou cestou. Náprava je levný, rozhodný první tah: klasifikuj záměr, vytáhni entity, vyřeš čas.

Číst článek