# Ako ušetriť tokeny pri práci s AI

> Praktické tipy, ako správnou voľbou modelu, plánovaním, kompaktovaním a subagentmi znížiť spotrebu tokenov aj náklady pri práci s AI.

**Kategória:** Guides  
**Autor:** denis-capkovic  
**Publikované:** 2026-09-09  
**Čas čítania:** 7 min

---
Cena AI sa odvíja od troch vecí:

1. Aký model používame.
2. Aký dlhý je chat (kontext).
3. Či používame cache.

Vysvetlíme si, čo každý bod znamená, a uvedieme ho do praxe. Zároveň si na konci spravíme súhrn a dáme pár praktických rád, ako pristupovať k práci a šetriť náklady.

## 1. Správny model na prácu

AI modely vychádzajú každý týždeň, či už od veľkých amerických alebo čínskych výskumných laboratórií, alebo od technologických firiem. Rôzne modely majú rôzne zameranie a sú lepšie či horšie v rôznych kategóriách. Tieto rozdiely sa často dajú zistiť až pri používaní, keďže testy ich odhaľujú len ťažko. Jednoduché meradlo však je: čím je model väčší, tým je lepší, ale zároveň aj drahší.

V Praktiku máme v podstate tri kategórie modelov: malý, stredný a veľký. Malé modely využívame na sumarizáciu zákonov, extrakciu zmluvných strán, pomenovanie chatov a mnohé ďalšie jednoduché práce. Stredné modely sa využívajú najčastejšie, či už je to v tabuľkách, pri subagentovi na rešerš (viac neskôr), alebo v samotnom chate. Veľké modely sú dobré hlavne pri dlhších úlohách, plánovaní alebo zložitých prípadoch, kde treba viac premýšľania.

## 2. Cena sa odvíja od kontextu

Cena sa taktiež odvíja od kontextu, s ktorým agent narába. Nad kontextom môžeme rozmýšľať ako nad informáciami, ktoré má agent načítané. Keď mu pošlem správu, dám mu prečítať zákon alebo súdne rozhodnutie, toto všetko sa pridáva do jeho kontextu. Je to ako súbor, do ktorého sa pridáva text. Tento text môže pochádzať od vás, z dokumentu či z odpovede, ktorú agent napíše. Čím je kontext dlhší, tým viac tokenov musí model spracovať a tým je odpoveď drahšia.

Kontext je samozrejme obmedzený. Väčšina nových modelov má kontext s veľkosťou 1 milión tokenov, pričom jeden token je približne jedna slabika.

*([Vyskúšajte si, ako sa text rozdeľuje na tokeny.](https://huggingface.co/spaces/Xenova/the-tokenizer-playground))*

Model dokáže pri odpovedi pracovať iba s obmedzeným počtom slov. Po prekročení limitu sa preto staršie informácie nemusia zmestiť do jeho kontextu. Používateľ ich síce v chate stále vidí, ale AI k nim pri odpovedi nemusí mať prístup.

Preto sa robí automatické kompaktovanie. To znamená, že zoberieme všetky správy a spravíme z nich zhrnutie. Zahodíme tak zbytočné informácie a necháme si len to podstatné. Mieru zaplnenia kontextu vidíte na indikátore v hornej časti chatu. Ak agent dlho hľadal a má veľa informácií, kompaktovanie môžete spustiť aj manuálne so špecifickými inštrukciami, aby bolo zhrnutie lepšie.

Mimo stratégií, ktoré si povieme na konci, môžete na efektívne narábanie s kontextom využiť subagentov. Môžeme si to predstaviť tak, akoby ste dali kolegovi špecifickú úlohu na rešerš a on by vám priniesol len výsledok. Do kontextu sa tým pádom načíta len úloha a výsledok, nie všetky kroky, ktoré boli potrebné na dosiahnutie výsledku.

## 3. Cache

V neposlednom rade je tu cache. Keďže AI modely nepracujú priamo s textom, ale s číslami *([viac informácií o prompt cachingu](https://earendil.com/posts/prompt-caching/))*, je nutný proces prevodu medzi textom a číselnou reprezentáciou, s ktorou vie AI pracovať. Tento proces však nie je zadarmo a tvorí významnú časť ceny odpovede.

Keďže je tento prevod stále totožný, nemusí sa robiť zakaždým, ale vieme si ho uložiť do takzvanej cache. Vďaka cache je spracovanie kontextu rýchlejšie a násobne lacnejšie. Cache sa však po určitom čase vymaže. Ak teda máte aj dlhý chat, ale aktívne v ňom pracujete, cena je násobne nižšia, ako keby ste posielali jednu správu denne.

Samotná téma je dosť komplikovaná a závisí od mnohých detailov, ale netreba ju riešiť do hĺbky. To je naša starosť.

## Pár praktických rád k používaniu AI

### Model podľa potreby

V Praktiku si môžete vybrať z troch úrovní modelov. Na bežnú prácu odporúčame vybrať si „normálny“ model, keďže je na ňu prispôsobený. „Pokročilý“ model odporúčame vybrať si v špecifických prípadoch, konkrétne keď:

1. Odpoveď vyžaduje komplikovanú úvahu, pretože nemá jasnú odpoveď ani cestu, ako sa k nej dostať.
2. Úloha pozostáva z veľa krokov a vyžaduje komplikovaný postup. Príkladom je editovanie komplexného dokumentu, pri ktorom treba dodržať konkrétny postup.
3. Potrebujete vytvoriť plán na lepšie zvládnutie úlohy, keďže pokročilejší model vie lepšie vytvoriť plán a odhaliť v ňom nedostatky.

Pokročilý model nemá väčšie kontextové okno. Jeho výhodou je lepšie uvažovanie a plánovanie pri náročných úlohách.

### Tvorba plánu

Na plánovanie odporúčame využívať pokročilý model. Samotný prínos plánu spočíva v tom, že si spoločne s agentom dopredu naplánujete celú úlohu. Viete, ako chcete pokračovať a čo vyhľadávať, takže sa nestane, že si agent postup vymyslí za pochodu. Môžete mu napríklad povedať: „Najprv navrhni postup revízie tejto zmluvy a pred začatím počkaj na moje potvrdenie.“

Ak napríklad revidujete rozsiahlu zmluvu, zadajte agentovi naraz cieľ, podklady a schválený plán a nechajte ho dokončiť revíziu kontinuálne. Cena práce je vďaka cachingu násobne nižšia.

Ďalším prínosom plánovania s agentom je, že sa nezasekne a nezabudne na úlohu. Počas jej vykonávania sa bude pozerať na to, čo má robiť a ako má postupovať, a postupne si bude aktualizovať plán o nové informácie a zaznamenávať časti, ktoré už dokončil.

### Zastaviť, keď je to potrebné

Rovnako dôležité je povedať agentovi, kedy má zastaviť. Ak mu poviete, nech vám niečo nájde, bude to hľadať. To znamená, že ak to nie je v zákonoch, súdnych rozhodnutiach, stanoviskách ani iných dokumentoch z ministerstiev, začne sa pozerať na internet a hľadať odpoveď na vašu otázku. Na jednej strane je to dobré, ale **keď viete, že takáto informácia nemusí existovať, alebo viete, na aké zdroje sa má agent pozerať, je dobré mu to povedať. Zrýchlite a zlacnite tým odpoveď.**

Taktiež odporúčame vyžiadať si od agenta potvrdenie predtým, než začne pracovať. Napríklad predtým, než začne revidovať zmluvu, nech vám povie, ktoré oblasti ide upraviť a prečo. Viete si to jednoducho pozrieť a upraviť.

### Subagenti na konkrétnu prácu

Spomínali sme subagentov ako spôsob, ako môžete odovzdať prácu a dostať len výsledok. Podstatné je, že agent si nepotrebuje „pamätať“ všetky kroky, ktorými sa dostal k výsledku.

Ak napríklad potrebujete na zmluve skontrolovať platnosť údajov z ORSR, pozrieť všetky referencie na Obchodný zákonník a zároveň si prečítať súdne rozhodnutia spomínané v dokumente a preveriť, či existujú a či sú použité správne, môžete agentovi na konci promptu rovno povedať: **„Použi na každú úlohu subagenta.“** To je všetko, čo treba, aby tieto úlohy vykonal cez subagentov. Nielenže sú lacnejší, ale aj rýchlejší, keďže jednotlivé úlohy môžu prebiehať naraz.

### Kedy kompaktovať

Niekedy nie je úplne jasné, kedy sa oplatí kompaktovať. Určite to netreba preháňať a robiť príliš často, ale je to jeden zo spôsobov, ako môžete znížiť cenu a zvýšiť kvalitu odpovede.

Najlepším príkladom kompaktovania je situácia, keď robíte rešerš na tému, v ktorej nie ste zorientovaní, čiže neviete agenta správne nasmerovať. Musí preto veľa vyhľadávať, čítať a analyzovať. Aj keď vám následne pripraví odpoveď, má načítaných veľa zbytočných informácií, ktoré nie sú pre vašu prácu prospešné. Ak teda potrebujete zobrať výsledok a ďalej s ním pracovať, tieto informácie sú zbytočné.

V takomto prípade odporúčame manuálne kompaktovať konverzáciu, ideálne s konkrétnym promptom zameraným na účel zhrnutia.

Inak povedané, ak má agent informácie, ktoré sú pre jeho aktuálnu úlohu zbytočné, je lepšie kompaktovať.

### AI netreba na všetko

Nová AI technológia je síce úžasná, keďže vie pomôcť takmer v každom aspekte právnej praxe. To však neznamená, že je na všetko najlepšia, keďže špecifické postupy sú nielen omnoho lacnejšie, ale aj rádovo lepšie.

Ak potrebujete preložiť alebo anonymizovať dokument, prípadne overiť odkazy v dokumente, neodporúčame na to používať chat. V rámci prekladov máme v dokumentoch alebo vo Worde špecifickú funkciu založenú na DeepL. Je rýchlejšia, lacnejšia a hlavne kvalitnejšia.

To isté platí pri anonymizácii alebo overovaní platnosti odkazov. Praktik ich vie lepšie spraviť vo Worde.

### Zapisovať si postupy

Jedným z najväčších problémov pri používaní AI systémov je, keď systém nevie, ako má postupovať pri plnení vašej úlohy. K odpovedi sa síce dostane, ale trvá to dlho a skúša postupy, ktoré nevedú k správnemu výsledku.

Preto ak máte úlohu, ktorá sa vám často opakuje, odporúčame spraviť si z nej zručnosť *([video o úprave a vytváraní zručností](https://praktik.ai/sk/academy/agenti/13-uprava-a-vytvaranie-zrucnosti/))*. Agent si následne pri tejto úlohe načíta postup a presne vie, čo má robiť a ako má postupovať.