🎧 Poslouchej epizodu:
Poslední dobou slyším pořád stejnou větu. Firma přijde s tím, že chce používat AI, ale odmítá posílat data do Ameriky nebo do Číny. A řešení, které si vysní, zní vždycky podobně: „Rozjedeme si model u sebe.” 🤔 Zní to logicky. Vlastní model, vlastní data, klid. Jenže jakmile se do toho začneš vrtat, zjistíš, že „lokální AI” znamená v praxi něco úplně jiného, než si většina lidí představuje. A že ten nejlepší volně dostupný model dnes potřebuje 1,4 terabajtu paměti, takže si ho jen tak „u sebe” nikdo nerozjede. S Filipem jsme si sedli a pokusili se to rozplést - od pojmů, které se pořád slévají dohromady, až po tvrdou hardwarovou realitu. 👇
Open Weight vs. Open Source: rozdíl, který většina lidí míchá 🔍
Začnu tím nudným, ale zásadním rozdělením, protože bez něj se v tématu ztratíš hned na začátku. Existují tři úrovně toho, jak „otevřený” model je.
Open Weight znamená, že máš hotový model - takzvané otevřené váhy. Můžeš si ho vzít, spustit na svém serveru nebo počítači prakticky kdekoli, dokonce si ho můžeš dotrénovat. Ale je to černá skříňka. Nevíš, na jakých datech vznikl ani jak přesně byl natrénovaný. Filip to popsal technicky, mě ale při přípravě chytla jedna paralela, která to trefuje líp:
Open Weight je jako jídlo z luxusní restaurace. Máš ho na talíři, můžeš si ho dosolit, dopepřit, dělat si s ním, co chceš. Ale recept jsi nedostal a netušíš, z jakých surovin vznikl.
Open Source je o úroveň výš. Kromě modelu dostaneš i to, na čem a jak byl trénovaný - všechny dílky skládačky, takže teoreticky si ho natrénuješ sám. A Closed Source je pravý opak: modely jako Opus nebo GPT přes API. Používat je můžeš, ale nainstalovat nikam ne. Voláš do internetu, dostaneš odpověď, hotovo. 📌
A tady přichází první past. Open Weight totiž neznamená automaticky lokální. Znamená jen to, že model můžeš rozjet kdekoli. Jestli to bude tvůj notebook, nebo pronajaté datacentrum za miliony, to je úplně jiná pohádka - a rozhoduje o tom počet parametrů. Zapamatuj si to, za chvíli se k tomu vrátíme v celé kráse.
„Lokálně” skoro nikdy neznamená, že ti běží model ⚡
Tohle je největší zdroj zmatku v celém dílu a Filip na něj naráží pořád. Slovo „lokálně” se dnes automaticky čte jako „provozuju vlastní AI”. Jenže u dnešních agentů to tak vůbec nemusí být.
Vezmi si OpenClaw, o kterém jsme tady natáčeli celý díl, nebo Claude Cowork. Máš pocit, že ti běží „lokálně” na Macbooku. Ve skutečnosti tam žádný jazykový model nemáš. Běží ti tam jen harness - ta agentní obálka kolem modelu - a ta si pořád volá cloudový model od Anthropicu přes API na tvoje předplatné. Model je v Americe, harness u tebe.
Filip to zná z první ruky. Když k tomu vydával videa, dostával komentáře ve stylu „to přece není pravda, vždyť tam je model od Anthropicu”. A měli pravdu.
Já jako vývojář jsem zvyklý, že „lokálně” znamená na mém počítači. Ale nemusí se to týkat AI modelu. Může to být program nebo právě ta agentní harness. Lokálně fakt znamená jen „u mě na stroji”, ne „provozuju si vlastní inteligenci”.
Maximálně ti tam poběží nějaký malý Whisper, který přepisuje hlas na text. Samotný „mozek” je jinde. 💡 Když si tohle jednou uvědomíš, přestaneš se nechat balamutit marketingem a začneš se ptát na správnou otázku: co konkrétně z toho řetězce běží u mě a co v cloudu?
Kdy se vlastní model vyplatí (a kdy je to jen dražší cesta) 🎯
Dobře, proč by si to tedy někdo pod sebe tahal? Důvody jsou v zásadě čtyři.
Data zůstanou u tebe. Tohle je ten největší. Můžeš mít model ve vnitřní firemní síti, která ani není připojená k internetu. Nikam nic neodesíláš. Když to posíláš Anthropicu, data vždycky projdou přes Ameriku - i v rámci GDPR na to existují cesty, jak jsme rozebírali s Vojtou Tůmou. Nezávislost je druhý důvod: co když nám poskytovatel vypadne, nebo nám to prostě vypnou? Vzpomeň si na Fable, který americká vláda nepustila do Evropy - my jako evropští uživatelé jsme k němu zpočátku neměli přístup. Když vlastníš váhy, tohle se ti stát nemůže. Třetí je latence (u detekce objektu v obraze je rozdíl mezi 30 a 300 milisekundami znát) a čtvrtá cena - ale k té se dostanu, protože je zrádná.
Zajímavé je, že Filip jde proti očekávání i u bezpečnosti. Menší firmy podle něj sázejí na vlastní železo z pocitu, že je bezpečnější. Realita bývá opačná: zabezpečit si vlastní servery je extrémně složitá disciplína a velké cloudové firmy to proti útoku zvenčí zvládají líp než malá firma s jedním ITčkářem. Pozor ale - to je odpověď na útok zvenčí, ne na otázku, jestli věříš poskytovateli, co s daty dělá. To jsou dvě různé věci. 🤔
A teď ta zrádná cena. Když chceš stejnou inteligenci jako od Opusu 5, potřebuješ něco jako Kimi K3. A ten je tak obrovský, že ho nerozjedeš ani na běžném serveru - potřebuješ šest až osm zřetězených specializovaných čipů a přes 1,4 terabajtu paměti. Předchozí Kimi K2 se ještě vešla na dvě spojená Mac Studia, jenže jedno stojí kolem 250 tisíc, takže jsi na půl milionu korun jen za hardware. Inference po tokenech u poskytovatele vyjde zásadně levněji. Takže velký lokální model ti reálně neušetří skoro nic.
Kde open weight vyhrává, jsou úzké opakované úlohy. Nepotřebuješ frontier agenta na to, abys klasifikoval, jestli je příchozí text poptávka nebo dotaz, nebo abys něco dohledal ve vlastní knowledge base. Na to stačí model s deseti miliardami parametrů, který rozjedeš na lepším notebooku. A tady se otevírá elegantní myšlenka: malý lokální model jako router, který sám rozhodne, jestli úlohu zvládne, nebo ji pošle na drahý cloudový model. Přesně na tuhle úvahu jsme naráželi v dílu o zdražování AI.
Proč to dnes skoro nikdo neřeší? Protože se to nevyplatí. Dotované předplatné je levnější než čas strávený laděním pipeline. Změní se to, až utáhnou limity - nebo až to za nás vyřeší software. Protipříklad zazněl už v prvním Sessions s Jirkou Štěpánkem: u statisíců operací měsíčně se každý ušetřený cent násobí a najednou dává lokální model obrovský smysl.
Proč někdo dá model zadarmo - a česká stopa 🚀
Když trénink modelu stojí miliony dolarů, proč by ho někdo pouštěl volně ven? Motivací je několik.
Podpora byznysu. NVIDIA potřebuje prodávat čipy, tak logicky dodá i software, který na nich běží. Filip to shrnul přesně: prodáváš lopaty, tak lidem rozdej mapy k zlatu, ať to zlato - tedy AI - vůbec začnou kutat. Výzkumné instituce publikují z principu, žijí z grantů a papery jsou veřejné. A pak je tu konkurenční boj: spekuluje se, že právě čínský DeepSeek mohl být pokus otřást výsadním postavením velkých AI labů. Nemusíš vydat lepší model, stačí něco o kousek horšího hodit zadarmo všem - a otřeseš jejich business modelem.
A pak je tu čtvrtý důvod, ryzí PR a nábor. Což nás vede k české stopě. Firma BottleCap AI kolem Jardy Beka a Tomáše Mikolova nedávno vydala model ThinkingCap. Není to model od nuly - je to fine-tune open source Qwenu, který šetří tokeny v reasoningu. V epizodě jsme házeli odhad 40 až 50 %, oficiální číslo je 46 % v průměru. 📌
Na Hugging Face měl přes 30 tisíc stažení, což byl suverénně nejstahovanější model, na který jsem tam narazil. Filip pointu vystihl přesně: hodnotu nehledej v modelu samotném, ale v tom, kdo se díky němu ozve. Nevydáváš ho, protože bys na něm vydělal - je to PR ve stylu „hele, my to umíme”. Dáš to ven a pak už volají investoři a firmy. Jarda Beck prý teď lítá po San Franciscu ze schůzky na schůzku.
Malá odbočka, která mě dostala: do BottleCap AI zainvestoval i Nico Rosberg, bývalý mistr světa Formule 1. I piloti F1 už jsou v AI byznysu. 😄
Každou sobotu takhle rozebereme jedno téma v podcastu do hloubky. Napiš nám, jaké téma máme příště rozpitvat. 👇
Ramageddon: jak AI zdražila věci úplně všem 💸
Když jsme se bavili o té paměti, došlo i na téma, které se dotýká i lidí, co si žádnou AI nikdy nespustí. Filip pro to přinesl slovo, které jsem předtím neznal: ramageddon. Jako armageddon, ale u ramek.
Ceny paměti a SSD vystřelily nahoru šíleným způsobem. Konkrétní příklad z vlastní kapsy: chtěl jsem koupit větší externí SSD na zálohy našich epizod. Na začátku roku stál 9 tisíc, teď stojí 25 tisíc - víc než 130 % nahoru. Takže zatím máme zálohy prostě u mě na Macu. 😅 Média mluví o zdražení pamětí zhruba o 90 %. Apple úplně zaříznul 512GB verzi Mac Studia a podle rumorů podraží i nový iPhone.
Důvod je jednoduchý. Zhruba 70 % výpočetního výkonu dnešních datacenter jede na AI, a ta spolkne prakticky veškeré zásoby čipů. A tady přichází otevřený závěr celého dílu - Jevonsův paradox. Když nějakou komoditu zefektivníš a zlevníš, náklady neklesnou. Naopak, protože je dostupnější, začne ji používat víc lidí na víc věcí a celková spotřeba vystřelí.
Budeme dělat efektivnější a úspornější modely. Jenže tím se otevře víc a víc use casů, poptávka poroste - a já jsem zvědavý, kdy tahle spirála skončí.
Chceš si to zkusit? Nejjednodušší cesty 👉
Nechci, aby to vyznělo, že lokální modely jsou jen pro nadšence s půl milionem v hardwaru. Spousta z nich běží úplně v pohodě a nejběžnější použití open weight modelů ani nejsou LLM - jsou to diktovací apky. Když někde diktuješ hlasem, s velkou pravděpodobností pod tím jede Whisper od OpenAI nebo Parakeet od NVIDIE, lokálně a offline. Pak je tu generování obrázků (lokální ComfyUI vs. cloudová Nano Banana) a text to speech.
U menších modelů narazíš na jeden háček - češtinu. Malé modely na ní typicky nejsou trénované, takže komolí slovosled a plácají překlepy. Hack z epizody: mluv na ně anglicky, výsledky budou znatelně lepší. Čím menší model, tím míň informací pojme, a česky umí zřídkakdo. Filip to řekl natvrdo: „Kolik nás je? Deset milionů. To je míň než New York, takže to nikdo moc neřeší.” 🇨🇿 Přesto ti třeba Gemma od Googlu, která běží i na telefonu, klidně shrne dlouhou notifikaci - a to je přesně ta budoucnost, které se říká Edge AI: robotika, samořiditelná auta, rozpoznávání předmětů v apkách pro nevidomé, všechno bez závislosti na připojení.
A jak si sáhnout? Tři cesty:
Ollama 👉 nejjednodušší vstup. Stáhneš appku, v menu vybereš model, chatuješ - a klidně si vytrhni kabel od internetu, ať se přesvědčíš, že to fakt běží u tebe.
Hugging Face 👉 buď model rozjedeš v jejich cloudu (něco zdarma, něco za peníze), nebo si stáhneš váhy k sobě.
Claude Code 👉 tohle je dnes ta krása. Řekneš mu „chtěl bych si rozjet tenhle model z Hugging Face, můžu?”, on se podívá na parametry tvého počítače, řekne ti, jestli to půjde a jak rychle, a pak ti to rovnou nainstaluje.
Nakonec je to vždycky trojúhelník kvalita - rychlost - cena, ve kterém si musíš vybrat priority. Pro většinu lidí zatím lokální modely nic zásadního nepřinášejí. Ale pro specializované, opakované úlohy mají své kouzlo - hledat nejmenší model, který ještě dá smysluplný výsledek.
TL;DR - co si z toho vzít 📌
Tři úrovně otevřenosti. 🔍 Open Weight = máš hotový model, ne recept. Open Source = máš i data a postup. Closed Source = jen API. A Open Weight neznamená automaticky lokální.
„Lokálně” ≠ vlastní model. ⚡ U agentů jako OpenClaw nebo Cowork ti na počítači běží jen harness, samotný model je pořád v cloudu na předplatné.
Velký lokální model neušetří. 🎯 Kimi K3 chce přes 1,4 TB paměti a datacentrum. Open weight vyhrává jen u úzkých úloh - klasifikace, přepis, hledání ve vlastní knowledge base.
Ramageddon se týká všech. 💸 SSD a RAM zdražily o desítky procent (média mluví o ~90 %), protože ~70 % compute datacenter dnes jede na AI. Dopad cítí i ten, kdo AI nikdy nespustí.
Zkus to přes Ollamu. 🚀 Stáhneš, vybereš model, chatuješ offline. A na malé modely mluv anglicky - v češtině zatím kulhají.
Líbí se ti Deeplink Show?
👉 Sleduj nás na YouTube - video verze každé epizody
🎧 Followni Deeplink Show na Spotify - pro poslech kdekoli
🌎 Mrkni na náš web - pro další detaily podcastu
📸 Sleduj nás na Instagramu - zkratky, tipy a zákulisí
Nebo nám napiš co si myslíš: studio@deeplink.show ✉️



