Jaký počítač na lokální AI potřebuješ?

O počítači na lokální AI rozhoduje kapacita paměti grafické karty, ne její výkon. Model se do paměti buď vejde a poběží svižně, nebo se nevejde a spadne na procesor, kde bude pomalý až k nepoužitelnosti. Praktické pravidlo zní zhruba 0,6 GB paměti na miliardu parametrů při běžné čtyřbitové kvantizaci, k tomu je nutná rezerva na kontext. Osmigigabajtová karta tak zvládne model s osmi miliardami parametrů, dvanáct gigabajtů stačí na čtrnáct miliard a šestnáct gigabajtů otevře modely kolem třiceti miliard, což je pro domácí použití sladké místo. Procesor, operační paměť a disk jsou v tomhle žebříčku až za grafikou. Pro čistou inferenci jsou dnes použitelné karty NVIDIA i AMD, u dolaďování vlastních modelů má NVIDIA stále navrch.

Spouštět jazykový model nebo generovat obrázky přímo na svém počítači dává smysl hned z několika důvodů: data zůstanou doma, neplatíš měsíční předplatné a nikdo ti nemůže model přes noc změnit. Otázka pak zní jednoduše, co na to potřebuješ za železo.

Otevřená skříň herního počítače s velkou grafickou kartou na pracovním stole v domácí pracovně

Odpověď je naštěstí přímočařejší, než by se čekalo, protože rozhoduje jediný parametr. Projdu s tebou, který to je, kolik ho potřebuješ na konkrétní velikost modelu, kde jsou rozdíly mezi kartami NVIDIA a AMD a jaké sestavy z mé nabídky na jednotlivé úrovně sedí.

Poslední aktualizace obsahu:

1. Co znamená lokální AI

Lokální AI znamená, že model běží celý na tvém počítači a žádná data neopouštějí tvůj stůl. Stáhneš si soubor s modelem, spustíš program, který ho umí načíst, a od té chvíle funguje i bez připojení k internetu.

Nejčastěji jde o tři věci. Jazykový model pro psaní a odpovídání na dotazy, generování obrázků a lokální přepis mluveného slova. Každá z nich má trochu jiné nároky, ale všechny narážejí na tentýž limit.

Praktické důvody, proč to lidi chtějí, bývají tři: citlivá data, která nemají opouštět firmu, žádné měsíční předplatné a jistota, že model zůstane přesně takový, jaký jsi ho stáhl.

2. Paměť grafické karty je tvrdý strop

Model musí být při běhu celý v paměti grafické karty. Tohle je zásadní rozdíl proti hrám, kde nedostatek paměti způsobí trhání, ale hra pojede dál. U lokální AI je to binární: buď se vejde, nebo ne.

Když se model nevejde, program ho rozdělí a část nechá počítat procesor. Rozdíl v rychlosti je propastný, protože procesor má proti kartě zlomek paměťové propustnosti. Z odpovědi za tři sekundy se rázem stane odpověď za minutu a půl.

Proto platí, že karta s větší pamětí a nižším výkonem porazí rychlejší kartu s menší pamětí. Pomalejší karta, do které se model vejde, dá odpověď za pár sekund. Rychlejší karta, do které se nevejde, bude trápit tebe i sebe. U lokální AI je kapacita paměti první parametr, na který se dívám, a teprve pak řeším cokoli dalšího.

Rozebral jsem tuhle logiku i z pohledu hraní v článku o tom, jaký je rozdíl mezi RX 9060 XT s 8GB a 16GB. U AI je ten rozdíl ještě vyhrocenější.

3. Kolik paměti potřebuješ na jaký model

Velikost jazykového modelu se udává v miliardách parametrů. Model se před stažením takzvaně kvantizuje, tedy převede do nižší přesnosti, aby zabral míň místa. Běžným standardem je čtyřbitová kvantizace, u které ztráta kvality bývá malá, zato úspora paměti čtyřnásobná.

Pro čtyřbitovou kvantizaci platí praktické pravidlo zhruba 0,6 GB paměti na jednu miliardu parametrů. Z toho vyjde následující tabulka.

Velikost modelu Zabere v paměti Minimum paměti karty K čemu se hodí
3 až 4 miliardy 2 až 3 GB 6 GB Jednoduché dotazy, shrnutí krátkých textů
7 až 8 miliard 5 až 6 GB 8 GB Běžná konverzace, psaní, základní pomoc s kódem
12 až 14 miliard zhruba 9 GB 12 GB Znatelně lepší odpovědi, delší texty
24 miliard 14 až 15 GB 16 GB Solidní kvalita pro každodenní práci
30 až 32 miliard 19 až 20 GB 24 GB nebo 32 GB Nejlepší, co dnes rozjedeš na jedné herní kartě
70 miliard zhruba 40 GB Mimo dosah jedné herní karty Vyžaduje dvě karty nebo profesionální hardware

Sloupec s minimem paměti karty už počítá s rezervou pro kontext a pro samotný operační systém, který si z karty taky kus ukousne. Nejde tedy o holou velikost souboru s modelem.

4. Rezerva na kontext, na kterou se zapomíná

Kontext je všechno, co si model v konverzaci pamatuje, tedy tvoje dotazy, jeho odpovědi a případně vložené dokumenty. Uloženému kontextu se říká cache a leží také v paměti karty.

A tady je zádrhel: cache roste s délkou konverzace a u dlouhých kontextů může nabobtnat tak, že se velikostí vyrovná samotnému modelu. Model, který se ti při krátkých dotazech vejde s rezervou, tak po hodině práce s dlouhým dokumentem začne přetékat.

Praktický dopad je jednoduchý. Když plánuješ vkládat celé dokumenty nebo vést dlouhé konverzace, počítej s kartou o jednu hladinu paměti výš, než ti vychází z tabulky. Šestnáct gigabajtů proti dvanácti tady dělá zásadní rozdíl.

5. NVIDIA, nebo AMD na lokální AI?

Ještě před dvěma lety byla odpověď jednoznačně NVIDIA. Dnes už tak jednoznačná není a je fér to říct nahlas, i když se tím trochu komplikuje doporučování.

Kde je to dnes vyrovnané

Pro čisté spouštění hotových jazykových modelů, čemuž se říká inference, jsou karty AMD řady RX 9000 plnohodnotná volba. Softwarová vrstva ROCm už architekturu RDNA 4 podporuje nativně i ve Windows a běžné programy pro lokální modely si kartu najdou samy, bez ručního nastavování.

Pro naprostou většinu lidí, kteří chtějí prostě spustit stažený model a povídat si s ním, je tedy Radeon se šestnácti gigabajty velmi dobrá koupě.

Kde má NVIDIA pořád navrch

Rozdíl zůstává u okrajových a pokročilých věcí. Dolaďování vlastního modelu, experimentální nástroje a novější výzkumné projekty počítají v prvé řadě s prostředím CUDA od NVIDIE. Podpora pro AMD tam přichází později nebo nepřijde vůbec.

Druhá výhoda je praktická: návodů a hotových řešení pro NVIDII je na internetu řádově víc, takže když se něco zasekne, najdeš odpověď rychleji.

Jak to shrnuju zákazníkům po telefonu

Chceš spouštět hotové modely a mít klid? Radeon se šestnácti gigabajty ti dá nejvíc paměti za peníze a funguje. Chceš si s tím hrát do hloubky, dolaďovat vlastní modely nebo zkoušet čerstvé nástroje z internetu? Sáhni po NVIDII, ušetříš si večery strávené hledáním, proč něco nejde.

6. Procesor, operační paměť a disk

Zbytek sestavy je u lokální AI podružný, ale úplně jedno to není. Tady je pořadí, ve kterém na tom záleží.

Operační paměť

Druhá nejdůležitější položka po grafické kartě. Model se do ní načte, než se přesune na kartu, a při práci s velkými soubory se hodí i dál. Doporučuju 32 GB, což je stejně kapacita, se kterou dnes stavím většinu herních sestav. U šestnácti gigabajtů narazíš, jakmile budeš chtít mít vedle modelu otevřený i prohlížeč a další práci.

Procesor

Když model běží celý na kartě, procesor se skoro nudí. Význam získá až ve chvíli, kdy se model do karty nevejde a část výpočtu spadne na něj — jenže to je přesně situace, které se chceš vyhnout. Běžný herní procesor střední třídy naprosto stačí a peníze navíc dej raději do karty.

Disk

Modely jsou velké soubory, běžně pět až dvacet gigabajtů na kus, a rychle se jich nasbírá víc. Rychlé NVMe SSD zkrátí čekání při načítání modelu do paměti. Hlavní je ale kapacita: 2 TB ti dá klid, u jednoho terabajtu začneš dřív nebo později mazat.

Postavím ti počítač, na kterém se model rozjede na první pokus

Poradím ti s kapacitou paměti karty podle toho, co chceš spouštět, a sestavu složím, vyladím v BIOSu a před expedicí protáhnu zátěžovým testem osobně v Plzni. Napiš mi, co s tím plánuješ dělat, a upravím konfiguraci na míru.

7. Generování obrázků má trochu jiná pravidla

U generování obrazu je paměť karty stejně důležitá, ale nároky rostou jinak. Nerozhoduje počet parametrů modelu, nýbrž rozlišení výstupu a to, kolik obrázků chceš vyrábět najednou.

Osm gigabajtů stačí na základní generování v běžném rozlišení, ale s omezeními. Šestnáct gigabajtů otevře vyšší rozlišení, práci s více modely současně a doplňkové nástroje pro řízení kompozice, které si ukousnou další paměť.

Na rozdíl od jazykových modelů se tady výrazněji projeví i hrubý výkon karty, protože generování jednoho obrázku je výpočetně náročné od začátku do konce. Tenzorová jádra a AI akcelerátory, které jsem rozebral v článku o tom, k čemu jsou AI jádra v procesoru a grafické kartě, tady odvedou většinu práce.

8. Kterou sestavu si vybrat

Převedeno do konkrétních karet z mé nabídky vyjdou čtyři hladiny. U každé je uvedené, kam s ní dosáhneš.

Paměť karty Karty v nabídce Co na tom rozjedeš
8 GB RTX 5060, RX 9060 XT ve variantě 8GB Modely do 8 miliard parametrů, kratší konverzace
12 GB RTX 5070 Modely do 14 miliard, rozumná délka kontextu
16 GB RX 9060 XT 16GB, RTX 5060 Ti 16GB, RTX 5070 Ti, RX 9070 XT, RTX 5080 Modely kolem 24 miliard s dlouhým kontextem
32 GB RTX 5090 Modely nad 30 miliard, generování obrazu bez kompromisů

💬 Chci si to jen zkusit

Model do osmi miliard parametrů zvládne odpovídat, psát a pomoct s jednoduchým kódem. Nejlevnější rozumný vstup jsou sestavy s RTX 5060 nebo RTX 5070 s dvanácti gigabajty, pokud chceš mít rezervu.

🎯 Chci to používat denně

Šestnáct gigabajtů je sladké místo pro domácí použití a poměr ceny k použitelnosti tady vychází nejlíp. Vyber si mezi sestavami s RX 9060 XT, RTX 5060 Ti nebo RTX 5070 Ti.

🚀 Chci maximum bez kompromisů

Větší modely, dlouhý kontext i generování obrazu ve vysokém rozlišení najednou. Sáhni po RX 9070 XT, RTX 5080 nebo rovnou do kategorie high-end sestav.

Nebo si projdi nabídku podle výrobce grafiky a rozhodni se podle rozpočtu:

Sestavy s NVIDIA Sestavy s AMD Radeon

9. Čím začít, když počítač už máš

Vyzkoušet si to jde zadarmo a během dvaceti minut. Nepotřebuješ programátorské znalosti ani příkazovou řádku.

1

Zjisti, kolik má tvoje karta paměti. Otevři Správce úloh, kartu Výkon a vyber grafický procesor. Kapacita je uvedená jako vyhrazená paměť GPU.

2

Nainstaluj si program s grafickým rozhraním, který umí modely stahovat i spouštět. Kartu si najde sám a u karet AMD i NVIDIA se postup neliší.

3

Stáhni model o velikost menší, než ti vychází z tabulky výše. Ověříš si, že všechno funguje, a teprve pak zkoušej větší.

4

Při první konverzaci sleduj vytížení karty ve Správci úloh. Když je paměť karty plná a zároveň se hodně vytěžuje procesor, model se nevešel a běží zčásti mimo kartu.

Tenhle poslední bod je nejcennější test. Rozdíl mezi modelem, který se vešel, a modelem, který nevešel, poznáš okamžitě podle rychlosti odpovědí.

10. Co si k tomu přečíst dál

Navazující témata, která ti pomůžou dotáhnout výběr celé sestavy.

11. Časté dotazy k počítači na lokální AI (FAQ)

❓ 1. Kolik paměti grafické karty potřebuju na lokální AI?
Záleží na velikosti modelu. Praktické pravidlo pro běžnou čtyřbitovou kvantizaci je zhruba 0,6 GB paměti na jednu miliardu parametrů, k tomu je nutná rezerva na kontext a operační systém. Osmigigabajtová karta zvládne model s osmi miliardami parametrů, dvanáct gigabajtů stačí na čtrnáct miliard a šestnáct gigabajtů otevře modely kolem dvaceti čtyř miliard. Pro domácí použití je šestnáct gigabajtů nejrozumnější volba.
❓ 2. Co se stane, když se model do paměti karty nevejde?
Program model rozdělí a část nechá počítat procesor. Rozdíl v rychlosti je propastný, protože procesor má proti grafické kartě zlomek paměťové propustnosti. Z odpovědi za pár sekund se tak stane odpověď za minutu i víc. Model se většinou spustí, ale práce s ním přestane být příjemná. Právě proto je kapacita paměti u lokální AI důležitější než hrubý výkon karty.
❓ 3. Je lepší rychlejší karta s menší pamětí, nebo pomalejší s větší?
U lokální AI jednoznačně ta s větší pamětí. Pomalejší karta, do které se model celý vejde, odpoví za pár sekund. Rychlejší karta, do které se nevejde, bude část výpočtu posílat na procesor a výsledek bude řádově pomalejší. U hraní tohle pravidlo neplatí tak striktně, tam se nedostatek paměti projeví trhaným obrazem, ale hra běží dál.
❓ 4. Co je kvantizace modelu?
Kvantizace je převod modelu do nižší číselné přesnosti, aby zabral míň paměti. Nejběžnějším standardem je čtyřbitová varianta, která proti plné přesnosti sníží nároky zhruba na čtvrtinu, přičemž ztráta kvality odpovědí bývá malá. Modely se ke stažení běžně nabízejí rovnou v několika úrovních kvantizace a program pro spouštění si obvykle vybere vhodnou sám podle tvého hardwaru.
❓ 5. Proč potřebuju rezervu na kontext?
Kontext je všechno, co si model v konverzaci pamatuje, tedy tvoje dotazy, jeho odpovědi a vložené dokumenty. Uložený kontext leží také v paměti grafické karty a roste s délkou konverzace. U dlouhých konverzací nebo při vkládání celých dokumentů se může velikostí vyrovnat samotnému modelu. Model, který se ti při krátkých dotazech vejde s rezervou, tak po delší práci začne přetékat.
❓ 6. Fungují na lokální AI grafické karty AMD?
Ano. Pro spouštění hotových jazykových modelů jsou karty řady Radeon RX 9000 plnohodnotná volba. Softwarová vrstva ROCm podporuje architekturu RDNA 4 nativně i ve Windows a běžné programy pro lokální modely si kartu najdou samy bez ručního nastavování. Rozdíl proti NVIDII zůstává u dolaďování vlastních modelů a u experimentálních nástrojů, kde má prostředí CUDA stále navrch.
❓ 7. Jaký procesor potřebuju na lokální AI?
Běžný herní procesor střední třídy naprosto stačí. Když model běží celý v paměti grafické karty, procesor se skoro nudí a na rychlost odpovědí nemá znatelný vliv. Význam získá až ve chvíli, kdy se model do karty nevejde a část výpočtu spadne na něj, což je ale přesně situace, které se chceš vyhnout. Peníze navíc proto vždycky raději dej do grafické karty.
❓ 8. Kolik operační paměti potřebuju?
Doporučuju 32 GB, což je zároveň kapacita, se kterou stavím většinu herních sestav. Model se do operační paměti načte, než se přesune na grafickou kartu, a hodí se i při práci s většími soubory. U šestnácti gigabajtů narazíš ve chvíli, kdy budeš chtít mít vedle běžícího modelu otevřený prohlížeč a další práci. Není to ale parametr, kvůli kterému bys měl šetřit na grafické kartě.
❓ 9. Kolik místa na disku zaberou modely?
Jeden model běžně zabere pět až dvacet gigabajtů podle velikosti a úrovně kvantizace. Protože si člověk obvykle stáhne několik modelů, aby je porovnal, kapacita se plní rychle. Doporučuju 2 TB NVMe disk, u jednoho terabajtu začneš dřív nebo později mazat. Rychlost disku ovlivní jen dobu načítání modelu do paměti, samotný běh už ne.
❓ 10. Poznám, jestli model běží na kartě, nebo na procesoru?
Ano, a je to nejrychlejší test. Otevři Správce úloh a kartu Výkon. Když model odpovídá a přitom je paměť grafické karty plná a zároveň se výrazně vytěžuje procesor, znamená to, že se model celý nevešel a část výpočtu běží mimo kartu. Rozdíl poznáš i bez měření, protože odpovědi jsou v takovém případě znatelně pomalejší.
❓ 11. Liší se nároky u generování obrázků?
Ano. U generování obrazu nerozhoduje počet parametrů modelu, ale rozlišení výstupu a počet obrázků vyráběných najednou. Osm gigabajtů stačí na základní generování v běžném rozlišení s omezeními, šestnáct gigabajtů otevře vyšší rozlišení a práci s doplňkovými nástroji. Na rozdíl od jazykových modelů se tady výrazněji projeví i hrubý výkon karty, protože výpočet je náročný po celou dobu.
❓ 12. Zvládne lokální AI jednotka NPU v procesoru?
Na smysluplnou práci s jazykovými modely ne. Desktopové jednotky NPU jsou stavěné na nízký příkon při trvalém běhu, ne na výkon, a mají navíc k dispozici jen systémovou paměť s mnohem nižší propustností než paměť grafické karty. Pro lokální AI proto rozhoduje grafická karta a NPU se do rozhodování o sestavě prakticky nepromítá.
❓ 13. Dá se model spustit i bez grafické karty?
Technicky ano, program model spustí i čistě na procesoru s pomocí operační paměti. Rychlost je ale zlomková, protože procesor má proti grafické kartě podstatně nižší paměťovou propustnost. U menších modelů to je použitelné na vyzkoušení, u větších se odpovědi protáhnou natolik, že s tím nikdo pracovat nechce. Pro reálné použití je samostatná grafická karta nutnost.
❓ 14. Jakou sestavu mi doporučíš, když nevím, co budu spouštět?
Sáhni po kartě se šestnácti gigabajty paměti a operační paměti 32 GB. Je to hladina, ve které rozjedeš prakticky všechno, co dnes doma dává smysl, a zároveň zbude rezerva na delší konverzace i generování obrazu. Když si nejsi jistý, napiš mi, co s tím plánuješ dělat, a konfiguraci ti upravím na míru. Každou sestavu skládám i testuju osobně v Plzni.
Lukáš Blecha - Zakladatel BestComp

Lukáš Blecha

Zakladatel a hlavní IT architekt plzeňského e-shopu BestComp.cz. Sestavy pro zákazníky, kteří si chtějí modely pouštět doma, konfiguruju jinak než herní, protože tady se kapacita paměti karty nedá dohnat ani nejrychlejším procesorem, a to je rozdíl, který se v běžných doporučeních skoro nikdy neobjeví.

Diskuze (0)

Buďte první, kdo napíše příspěvek k této položce.

Nevyplňujte toto pole
×

Splátková kalkulačka ESSOX