On-premises AI: Argumenty pro provoz modelů ve vlastní infrastruktuře
Richard Pecha · CEO
Výchozí předpoklad je chybný
Většina nasazení AI začíná u cloudového API. Je to cesta nejmenšího odporu — rychlé zprovoznění, snadné iterace a modely jsou skutečně dobré. Pro řadu případů použití to naprosto stačí.
Existuje však významná skupina organizací, které pro své nejcennější případy použití cloudovou AI využít nemohou. Ne proto, že by byly přehnaně opatrné, ale protože data, o která jde — záznamy z policejního vyšetřování, zdravotní dokumentace pacientů, utajovaná dokumentace infrastruktury — nesmějí z právních ani provozních důvodů opustit jejich síť.
Pro tyto organizace nejde o volbu mezi cloudovou a on-premises AI. Jde o on-premises AI, nebo žádnou AI vůbec.
Co jsme postavili pro Policii ČR
Policie ČR potřebovala AI asistenta, který policistům pomůže prohledávat interní znalostní báze a zpracovávat dokumentaci. Omezení bylo absolutní: systém musel běžet v air-gapped síti s nulovým přenosem dat ven.
Nasadili jsme on-premises LLM postavený na modelu Llama 2, doladěný na jazykových datech specifických pro danou doménu v češtině. Systém se přes zabezpečená interní API integruje s vnitřními systémy správy dokumentů policie. Policisté s ním pracují prostřednictvím standardního webového rozhraní — s technickými detaily infrastruktury se nemusejí vůbec zabývat.
V produkčním provozu je od roku 2023. Žádné bezpečnostní incidenty. V roce 2024 jsme jeho rozsah rozšířili.
Technická realita on-premises LLM
Provoz výkonného jazykového modelu ve vlastní infrastruktuře vyžaduje nezanedbatelnou investici do hardwaru. Bavíme se o GPU serverech s dostatkem VRAM pro načtení modelu a obsluhu souběžných požadavků — konkrétní specifikace závisí na velikosti modelu a očekávané zátěži.
Ekosystém open-source modelů výrazně dozrál. Llama, Mistral a jejich deriváty jsou pro řadu podnikových případů použití opravdu schopné. Doladění na datech specifických pro danou doménu — zvláště u méně rozšířených jazyků, jako je čeština — výrazně zvyšuje výkon u úloh, na kterých záleží.
Latence inference je vyšší než u cloudového API, ale pro většinu případů zpracování dokumentů a vyhledávání se pohybuje v plně přijatelných mezích. Tento kompromis ve výkonu se vyplatí, když je alternativou nenasadit AI vůbec.
Kdy dává on-premises smysl
Rozhodovací rámec je přímočarý. Pokud vaše nejcennější případy použití AI pracují s daty, která nesmějí opustit vaši síť — utajované informace, zdravotní záznamy, vlastní duševní vlastnictví, regulovaná finanční data — potřebujete on-premises nasazení.
Pokud jsou vaše případy použití AI poměrně obecné a vaše data nejsou citlivá, je nejspíš správnou volbou cloudové API. Rychlejší iterace, lepší modely, nižší náklady na infrastrukturu.
Organizace, které to dělají špatně, jsou ty, jež sáhnou po cloudu jen proto, že je to jednodušší, a teprve v polovině projektu zjistí, že jejich právní nebo bezpečnostní tým s daným nakládáním s daty nesouhlasí. Zabudujte toto omezení do architektury hned od prvního dne.
Máte zájem o spolupráci?
Rádi si s vámi promluvíme.