O počítači na lokální AI rozhoduje kapacita paměti grafické karty, ne její výkon. Model se do paměti buď vejde a poběží svižně, nebo se nevejde a spadne na procesor, kde bude pomalý až k nepoužitelnosti. Praktické pravidlo zní zhruba 0,6 GB paměti na miliardu parametrů při běžné čtyřbitové kvantizaci, k tomu je nutná rezerva na kontext. Osmigigabajtová karta tak zvládne model s osmi miliardami parametrů, dvanáct gigabajtů stačí na čtrnáct miliard a šestnáct gigabajtů otevře modely kolem třiceti miliard, což je pro domácí použití sladké místo. Procesor, operační paměť a disk jsou v tomhle žebříčku až za grafikou. Pro čistou inferenci jsou dnes použitelné karty NVIDIA i AMD, u dolaďování vlastních modelů má NVIDIA stále navrch.
Spouštět jazykový model nebo generovat obrázky přímo na svém počítači dává smysl hned z několika důvodů: data zůstanou doma, neplatíš měsíční předplatné a nikdo ti nemůže model přes noc změnit. Otázka pak zní jednoduše, co na to potřebuješ za železo.

Odpověď je naštěstí přímočařejší, než by se čekalo, protože rozhoduje jediný parametr. Projdu s tebou, který to je, kolik ho potřebuješ na konkrétní velikost modelu, kde jsou rozdíly mezi kartami NVIDIA a AMD a jaké sestavy z mé nabídky na jednotlivé úrovně sedí.
Poslední aktualizace obsahu:
📋 Obsah článku:
1. Co znamená lokální AI
Lokální AI znamená, že model běží celý na tvém počítači a žádná data neopouštějí tvůj stůl. Stáhneš si soubor s modelem, spustíš program, který ho umí načíst, a od té chvíle funguje i bez připojení k internetu.
Nejčastěji jde o tři věci. Jazykový model pro psaní a odpovídání na dotazy, generování obrázků a lokální přepis mluveného slova. Každá z nich má trochu jiné nároky, ale všechny narážejí na tentýž limit.
Praktické důvody, proč to lidi chtějí, bývají tři: citlivá data, která nemají opouštět firmu, žádné měsíční předplatné a jistota, že model zůstane přesně takový, jaký jsi ho stáhl.
2. Paměť grafické karty je tvrdý strop
Model musí být při běhu celý v paměti grafické karty. Tohle je zásadní rozdíl proti hrám, kde nedostatek paměti způsobí trhání, ale hra pojede dál. U lokální AI je to binární: buď se vejde, nebo ne.
Když se model nevejde, program ho rozdělí a část nechá počítat procesor. Rozdíl v rychlosti je propastný, protože procesor má proti kartě zlomek paměťové propustnosti. Z odpovědi za tři sekundy se rázem stane odpověď za minutu a půl.
Proto platí, že karta s větší pamětí a nižším výkonem porazí rychlejší kartu s menší pamětí. Pomalejší karta, do které se model vejde, dá odpověď za pár sekund. Rychlejší karta, do které se nevejde, bude trápit tebe i sebe. U lokální AI je kapacita paměti první parametr, na který se dívám, a teprve pak řeším cokoli dalšího.
Rozebral jsem tuhle logiku i z pohledu hraní v článku o tom, jaký je rozdíl mezi RX 9060 XT s 8GB a 16GB. U AI je ten rozdíl ještě vyhrocenější.
3. Kolik paměti potřebuješ na jaký model
Velikost jazykového modelu se udává v miliardách parametrů. Model se před stažením takzvaně kvantizuje, tedy převede do nižší přesnosti, aby zabral míň místa. Běžným standardem je čtyřbitová kvantizace, u které ztráta kvality bývá malá, zato úspora paměti čtyřnásobná.
Pro čtyřbitovou kvantizaci platí praktické pravidlo zhruba 0,6 GB paměti na jednu miliardu parametrů. Z toho vyjde následující tabulka.
| Velikost modelu | Zabere v paměti | Minimum paměti karty | K čemu se hodí |
|---|---|---|---|
| 3 až 4 miliardy | 2 až 3 GB | 6 GB | Jednoduché dotazy, shrnutí krátkých textů |
| 7 až 8 miliard | 5 až 6 GB | 8 GB | Běžná konverzace, psaní, základní pomoc s kódem |
| 12 až 14 miliard | zhruba 9 GB | 12 GB | Znatelně lepší odpovědi, delší texty |
| 24 miliard | 14 až 15 GB | 16 GB | Solidní kvalita pro každodenní práci |
| 30 až 32 miliard | 19 až 20 GB | 24 GB nebo 32 GB | Nejlepší, co dnes rozjedeš na jedné herní kartě |
| 70 miliard | zhruba 40 GB | Mimo dosah jedné herní karty | Vyžaduje dvě karty nebo profesionální hardware |
Sloupec s minimem paměti karty už počítá s rezervou pro kontext a pro samotný operační systém, který si z karty taky kus ukousne. Nejde tedy o holou velikost souboru s modelem.
4. Rezerva na kontext, na kterou se zapomíná
Kontext je všechno, co si model v konverzaci pamatuje, tedy tvoje dotazy, jeho odpovědi a případně vložené dokumenty. Uloženému kontextu se říká cache a leží také v paměti karty.
A tady je zádrhel: cache roste s délkou konverzace a u dlouhých kontextů může nabobtnat tak, že se velikostí vyrovná samotnému modelu. Model, který se ti při krátkých dotazech vejde s rezervou, tak po hodině práce s dlouhým dokumentem začne přetékat.
Praktický dopad je jednoduchý. Když plánuješ vkládat celé dokumenty nebo vést dlouhé konverzace, počítej s kartou o jednu hladinu paměti výš, než ti vychází z tabulky. Šestnáct gigabajtů proti dvanácti tady dělá zásadní rozdíl.
5. NVIDIA, nebo AMD na lokální AI?
Ještě před dvěma lety byla odpověď jednoznačně NVIDIA. Dnes už tak jednoznačná není a je fér to říct nahlas, i když se tím trochu komplikuje doporučování.
Kde je to dnes vyrovnané
Pro čisté spouštění hotových jazykových modelů, čemuž se říká inference, jsou karty AMD řady RX 9000 plnohodnotná volba. Softwarová vrstva ROCm už architekturu RDNA 4 podporuje nativně i ve Windows a běžné programy pro lokální modely si kartu najdou samy, bez ručního nastavování.
Pro naprostou většinu lidí, kteří chtějí prostě spustit stažený model a povídat si s ním, je tedy Radeon se šestnácti gigabajty velmi dobrá koupě.
Kde má NVIDIA pořád navrch
Rozdíl zůstává u okrajových a pokročilých věcí. Dolaďování vlastního modelu, experimentální nástroje a novější výzkumné projekty počítají v prvé řadě s prostředím CUDA od NVIDIE. Podpora pro AMD tam přichází později nebo nepřijde vůbec.
Druhá výhoda je praktická: návodů a hotových řešení pro NVIDII je na internetu řádově víc, takže když se něco zasekne, najdeš odpověď rychleji.
Jak to shrnuju zákazníkům po telefonu
Chceš spouštět hotové modely a mít klid? Radeon se šestnácti gigabajty ti dá nejvíc paměti za peníze a funguje. Chceš si s tím hrát do hloubky, dolaďovat vlastní modely nebo zkoušet čerstvé nástroje z internetu? Sáhni po NVIDII, ušetříš si večery strávené hledáním, proč něco nejde.
6. Procesor, operační paměť a disk
Zbytek sestavy je u lokální AI podružný, ale úplně jedno to není. Tady je pořadí, ve kterém na tom záleží.
Operační paměť
Druhá nejdůležitější položka po grafické kartě. Model se do ní načte, než se přesune na kartu, a při práci s velkými soubory se hodí i dál. Doporučuju 32 GB, což je stejně kapacita, se kterou dnes stavím většinu herních sestav. U šestnácti gigabajtů narazíš, jakmile budeš chtít mít vedle modelu otevřený i prohlížeč a další práci.
Procesor
Když model běží celý na kartě, procesor se skoro nudí. Význam získá až ve chvíli, kdy se model do karty nevejde a část výpočtu spadne na něj — jenže to je přesně situace, které se chceš vyhnout. Běžný herní procesor střední třídy naprosto stačí a peníze navíc dej raději do karty.
Disk
Modely jsou velké soubory, běžně pět až dvacet gigabajtů na kus, a rychle se jich nasbírá víc. Rychlé NVMe SSD zkrátí čekání při načítání modelu do paměti. Hlavní je ale kapacita: 2 TB ti dá klid, u jednoho terabajtu začneš dřív nebo později mazat.
Postavím ti počítač, na kterém se model rozjede na první pokus
Poradím ti s kapacitou paměti karty podle toho, co chceš spouštět, a sestavu složím, vyladím v BIOSu a před expedicí protáhnu zátěžovým testem osobně v Plzni. Napiš mi, co s tím plánuješ dělat, a upravím konfiguraci na míru.
7. Generování obrázků má trochu jiná pravidla
U generování obrazu je paměť karty stejně důležitá, ale nároky rostou jinak. Nerozhoduje počet parametrů modelu, nýbrž rozlišení výstupu a to, kolik obrázků chceš vyrábět najednou.
Osm gigabajtů stačí na základní generování v běžném rozlišení, ale s omezeními. Šestnáct gigabajtů otevře vyšší rozlišení, práci s více modely současně a doplňkové nástroje pro řízení kompozice, které si ukousnou další paměť.
Na rozdíl od jazykových modelů se tady výrazněji projeví i hrubý výkon karty, protože generování jednoho obrázku je výpočetně náročné od začátku do konce. Tenzorová jádra a AI akcelerátory, které jsem rozebral v článku o tom, k čemu jsou AI jádra v procesoru a grafické kartě, tady odvedou většinu práce.
8. Kterou sestavu si vybrat
Převedeno do konkrétních karet z mé nabídky vyjdou čtyři hladiny. U každé je uvedené, kam s ní dosáhneš.
| Paměť karty | Karty v nabídce | Co na tom rozjedeš |
|---|---|---|
| 8 GB | RTX 5060, RX 9060 XT ve variantě 8GB | Modely do 8 miliard parametrů, kratší konverzace |
| 12 GB | RTX 5070 | Modely do 14 miliard, rozumná délka kontextu |
| 16 GB | RX 9060 XT 16GB, RTX 5060 Ti 16GB, RTX 5070 Ti, RX 9070 XT, RTX 5080 | Modely kolem 24 miliard s dlouhým kontextem |
| 32 GB | RTX 5090 | Modely nad 30 miliard, generování obrazu bez kompromisů |
💬 Chci si to jen zkusit
Model do osmi miliard parametrů zvládne odpovídat, psát a pomoct s jednoduchým kódem. Nejlevnější rozumný vstup jsou sestavy s RTX 5060 nebo RTX 5070 s dvanácti gigabajty, pokud chceš mít rezervu.
🎯 Chci to používat denně
Šestnáct gigabajtů je sladké místo pro domácí použití a poměr ceny k použitelnosti tady vychází nejlíp. Vyber si mezi sestavami s RX 9060 XT, RTX 5060 Ti nebo RTX 5070 Ti.
🚀 Chci maximum bez kompromisů
Větší modely, dlouhý kontext i generování obrazu ve vysokém rozlišení najednou. Sáhni po RX 9070 XT, RTX 5080 nebo rovnou do kategorie high-end sestav.
Nebo si projdi nabídku podle výrobce grafiky a rozhodni se podle rozpočtu:
Sestavy s NVIDIA Sestavy s AMD Radeon
9. Čím začít, když počítač už máš
Vyzkoušet si to jde zadarmo a během dvaceti minut. Nepotřebuješ programátorské znalosti ani příkazovou řádku.
Zjisti, kolik má tvoje karta paměti. Otevři Správce úloh, kartu Výkon a vyber grafický procesor. Kapacita je uvedená jako vyhrazená paměť GPU.
Nainstaluj si program s grafickým rozhraním, který umí modely stahovat i spouštět. Kartu si najde sám a u karet AMD i NVIDIA se postup neliší.
Stáhni model o velikost menší, než ti vychází z tabulky výše. Ověříš si, že všechno funguje, a teprve pak zkoušej větší.
Při první konverzaci sleduj vytížení karty ve Správci úloh. Když je paměť karty plná a zároveň se hodně vytěžuje procesor, model se nevešel a běží zčásti mimo kartu.
Tenhle poslední bod je nejcennější test. Rozdíl mezi modelem, který se vešel, a modelem, který nevešel, poznáš okamžitě podle rychlosti odpovědí.
10. Co si k tomu přečíst dál
Navazující témata, která ti pomůžou dotáhnout výběr celé sestavy.
- Co v kartě dělá co. Rozdíl mezi jádry CUDA, RT jádry a tenzorovými jádry: CUDA, RT a tenzorová jádra v grafické kartě.
- AI jednotky napříč počítačem. Proč jednotka NPU v procesoru na tohle nestačí: k čemu jsou AI jádra v procesoru a grafické kartě.
- Osm nebo šestnáct gigabajtů. Rozdíl na konkrétní kartě a konkrétních číslech: RX 9060 XT 8GB versus 16GB.
- Kolik operační paměti. Proč u AI doporučuju rovnou 32 GB: kolik RAM potřebuješ.
- Poměr ceny a výkonu u karet. Která dnes dává nejlepší smysl: nejvýhodnější grafické karty.
- Počítač na střih videa. Podobná logika, jiné priority: jaký PC na DaVinci Resolve.
