Google Cloud Run
(serverless kontajnery pre AI služby)
Google Cloud Run je služba od Google Cloud, ktorá ti umožní spustiť webovú aplikáciu alebo API zabalené v kontajneri bez toho, aby si riešil servery a škálovanie. V praxi je to pohodlný spôsob, ako nasadiť AI mikroslužby – napríklad endpoint na klasifikáciu, prepis textu, RAG gateway alebo webhook, ktorý orchestruje iné AI služby. Od roku 2025 Cloud Run podporuje aj GPU inštancie, čo z neho robí reálnu voľbu aj pre priamu inferenciu menších modelov – nielen pre "glue" vrstvy okolo nich.
1. Čo to je a prečo je to podstatné
Predstav si, že máš aplikáciu v kontajneri (Docker image) a chceš ju zverejniť ako URL. Pri tradičnom hostingu riešiš virtuálne stroje, load balancer, autoscaling, patchovanie, monitoring… Cloud Run to zoberie ako "balík" a urobí z neho službu, ktorú vie automaticky zapínať, vypínať a škálovať podľa dopytu.
- Serverless pre kontajnery: ty dodáš kontajner, platforma sa stará o infraštruktúru.
- Škálovanie podľa návštevnosti: keď príde viac requestov, pridajú sa inštancie; keď nič nechodí, vie to ísť až na nulu (a šetriť tak náklady).
- Rýchle nasadenie: z buildnutého image spravíš bežiacu službu s URL za pár minút.
- Jazyková nezávislosť: nezáleží, či píšeš v Node, Pythone, Go, Jave alebo inak – ak je to v kontajneri a vie to počúvať na porte, funguje to.
- Silné miesto pre "AI glue": Cloud Run typicky hrá rolu lepidla medzi frontendom, databázou, eventami a AI (Vertex AI, externé modely, vektorové databázy).
- GPU podpora od roku 2025: NVIDIA L4 GPU je dostupné priamo na Cloud Run – menšie open-source modely (napr. Mistral, Gemma, Phi) môžeš hostiť bez Kubernetes.
Pre AI je to podstatné najmä preto, že veľa užitočných AI riešení nie je "jeden veľký model", ale sústava menších služieb: validácia vstupov, správa promptov, cache, práca s dokumentmi, vyhľadávanie, hodnotenie odpovedí, audit logy. Cloud Run ti umožní každú z týchto vrstiev nasadiť, verzionovať a škálovať nezávisle.
2. Technické detaily, ktoré ťa v praxi zaujímajú
Cloud Run je najlepší, keď rozmýšľaš v štýle: "mám HTTP službu, ktorá spracuje request a vráti odpoveď." AI endpointy do toho typicky sedia: pošleš text, dostaneš JSON; pošleš dokument, dostaneš extrahované časti; pošleš otázku, dostaneš odpoveď alebo stream tokenov.
- Kontajner ako jednotka nasadenia: buildneš image (napr. cez Cloud Build alebo GitHub Actions), uložíš ho do Artifact Registry a nasadíš ako službu.
- Revízie a traffic split: každé nasadenie vytvorí novú revíziu; traffic vieš deliť medzi starou a novou verziou – ideálne na bezpečné rollouty promptových zmien.
- Concurrency: jedna inštancia môže obslúžiť viac requestov súčasne. Pre I/O-bound operácie (volania API, čítanie z DB) je to výhoda; pri CPU-bound AI inferenčnom kóde nastavuj concurrency opatrne.
- Streaming odpovedí: Cloud Run od roku 2024 plne podporuje HTTP streaming – môžeš posielať tokeny priebežne tak, ako ich generuje model, bez čakania na celú odpoveď.
- Volume mounts: od roku 2024 môžeš mountovať Cloud Storage buckety alebo NFS priamo do kontajnera. Pre AI to znamená jednoduchý prístup k modelovým artefaktom bez sťahovania do image.
- Sidecar kontajnery: jedna služba môže obsahovať viacero kontajnerov – napríklad hlavný inference server + proxy sidecar pre autentifikáciu alebo observabilitu.
- Ephemeral disk: lokálne súbory sú dočasné; čo má prežiť, patrí do objektového úložiska alebo databázy.
- Timeouty: maximálny timeout pre HTTP request je 3600 sekúnd – dostatok pre väčšinu AI úloh, no pri extrémne dlhých generovaniach radšej voľ async dizajn.
Rýchly prehľad parametrov:
| Oblasť | Čo to znamená v praxi | Dôsledok pre AI služby |
|---|---|---|
| Spustenie | Kontajner beží ako HTTP alebo gRPC služba | Ideálne pre inference API, gateway, webhooky |
| Škálovanie | Automatické pridávanie/uberanie inštancií na základe zaťaženia | Zvláda špičky, ale rieš "cold start" latency |
| Concurrency | Viac requestov na jednu inštanciu súčasne | Super pre I/O-bound, opatrne pri ťažkom CPU/GPU |
| Traffic split | Rozdelenie návštevnosti medzi revízie percentuálne | Bezpečné nasadenie prompt a logických zmien |
| Streaming | HTTP server-sent events a chunked transfer | Progresívne posielanie tokenov z LLM |
| GPU podpora | NVIDIA L4 na vybraných regiónoch | Priama inferencia menších open-source modelov |
| Volume mounts | GCS bucket alebo NFS ako priečinok v kontajneri | Zdieľané modelové váhy bez zopakovania buildu |
| Identity | Verejné alebo IAM-chránené endpointy | Interné AI endpointy vždy chráň |
| Integrácie | Logy, metriky, secrets, Pub/Sub, Cloud Tasks | Prakticky povinné pre produkciu |
3. GPU podpora a lokálna inferencia
Toto je najvýznamnejší posun od pôvodného vydania. Cloud Run s NVIDIA L4 GPU (dostupné od roku 2025) umožňuje hostiť open-source modely priamo na platforme – bez správy GKE clustra alebo VM.
Čo to prakticky znamená:
- Menšie modely (1–14 B parametrov): Gemma 3, Phi-4, Mistral 7B, Llama 3.2 – tieto modely bežia na L4 s prijateľnou latenciou.
- Inference frameworky: vSpace pre llama.cpp, vLLM, Ollama alebo TorchServe zabaľ do kontajnera rovnako ako akýkoľvek iný kód.
- Kedy to má zmysel: potrebuješ súkromie (dáta nesmú ísť k externému provideru), chceš vlastný fine-tuned model, alebo ti ekonomicky vychádza vlastná inferencia pri dostatočnom objeme.
- Kedy to nemá zmysel: pre väčšinu tímov je volanie Gemini alebo Claude API cez Vertex AI lacnejšie a jednoduchšie ako vlastný hosting modelu – L4 GPU na Cloud Run nie je zadarmo.
Upozornenie na cold start: GPU inštancie majú dlhší cold start ako CPU – model sa musí načítať do VRAM, čo pri väčších artefaktoch trvá desiatky sekúnd. Pre produkčné nasadenie GPU inference nastav minimálny počet inštancií aspoň na 1, čím sa cold start eliminuje za cenu minimálneho pohotovostného poplatku.
4. Integrácia s Google AI ekosystémom
Cloud Run nie je izolovaná služba – je súčasťou širšieho Google Cloud ekosystému, čo má pri AI práci konkrétne výhody.
- Vertex AI: Cloud Run môžeš kombinovať s Vertex AI Endpoints (pre väčšie modely), Vertex AI Search, Feature Store alebo Pipelines. Typická architektúra: Cloud Run rieši HTTP vrstvu, validáciu a orchestráciu; Vertex AI rieši ťažkú inferenciu.
- Agent Builder / Gemini API: Cloud Run je prirodzené miesto pre backend AI agentov – prijíma požiadavky, volá Gemini cez Vertex AI SDK a vracia štruktúrované odpovede.
- Pub/Sub a Cloud Tasks: event-driven AI pipeline – napr. nový dokument triggeruje Cloud Run job, ktorý ho spracuje, embeduje a uloží do vektorovej DB.
- AlloyDB / Cloud Spanner / Firestore: vektorové vyhľadávanie priamo v databáze (AlloyDB má vstavaný pgvector) – Cloud Run môže byť API vrstvou nad ním bez externej vektorovej DB.
- Secret Manager: API kľúče pre LLM providery (Anthropic, OpenAI, Google) nikdy nedávaj do image; Secret Manager ich bezpečne montuje pri štarte.
Praktická architektúra pre RAG v roku 2026 vyzerá takto: Cloud Run prijme dotaz, autentifikuje volajúceho (IAM alebo Identity Platform), zavolá embedding model (Vertex AI alebo lokálny), vyhľadá v AlloyDB, zostaví kontext a zavolá Gemini. Celá logika v jednej Cloud Run službe, všetko v rámci GCP bez egress poplatkov za komunikáciu medzi službami v tom istom regióne.
5. Dostupnosť: kde a ako to vieš použiť
Cloud Run nie je aplikácia, ktorú si nainštaluješ – je to cloudová služba, ktorú používaš cez konzolu, CLI alebo infra-as-code.
- Web konzola: rýchle prototypy, manuálne deploye, prehľad revízií, logov a metrík.
- CLI (
gcloud run deploy): opakovateľné nasadenia v CI/CD pipeline; zvyčajne základ automatizácie. - Terraform / Pulumi: infra-as-code pre tímy, kde sa cloudová konfigurácia verzionuje rovnako ako kód.
- HTTP aj event-driven: okrem klasického API Cloud Run reaguje na Pub/Sub správy, Cloud Storage eventy, Cloud Tasks a Cloud Scheduler – čo z neho robí základ aj pre asynchrónne AI workflow.
- Cloud Run Jobs: dávkové úlohy bez HTTP – preindexovanie dokumentov do vektorovej DB, nočné dávkové prepisy, generovanie reportov. Jobs sú oddelené od klasických Cloud Run služieb a majú vlastné škálovanie (paralelné tasky).
- Regióny: Cloud Run je dostupný vo väčšine GCP regiónov vrátane európskych (Belgicko, Frankfurt, Londýn, Varšava). GPU inštancie sú zatiaľ dostupné v obmedzenom počte regiónov – pred nasadením over aktuálny zoznam v dokumentácii.
6. Ceny a licencie: čo reálne platíš
Cloud Run účtuje podľa skutočnej spotreby – neplatíš za idle čas, len za aktívne spracovanie requestov a pridelenú pamäť.
- CPU a pamäť: účtuje sa za čas, kedy kontajner aktívne spracováva request (CPU-second a GB-second). Minimálne inštancie (ak ich nastavíš) sa účtujú vždy.
- Requesty: poplatok za počet prichádzajúcich HTTP requestov.
- Sieťová prevádzka (egress): prenos dát mimo GCP regiónu alebo medzi regiónmi je spoplatňovaný – pri AI, kde sťahuješ veľké modely alebo sieluješ veľa dát, môže byť táto položka prekvapivá.
- GPU: NVIDIA L4 GPU sa účtuje za dobu, kedy je inštancia aktívna – aj keď zrovna nespracováva request. To znamená, že GPU inference sa oplatí len pri dostatočnej vyťaženosti.
- Free tier: Google Cloud Run má bezplatný tier (v čase písania cca 2 milióny requestov a 360 000 vCPU-sekúnd mesačne), ale konkrétne limity overuj vždy v aktuálnom cenníku – menia sa.
- Licencie: Cloud Run samotný je proprietárna služba; tvoj kód a knižnice si prinášaš vlastné a ich licencie zostávajú na tebe.
Praktická kalkulácia: AI endpoint, ktorý väčšinu času spí a príde naň pár stoviek requestov denne, Cloud Run takmer nič nestojí. Ak hostuješ GPU model s minimálnou inštanciou 24/7, ráta s výdavkom v rádoch desiatok až stoviek dolárov mesačne – porovnaj s cenou Vertex AI Endpoints alebo externého API.
7. Bezpečnosť a súkromie: na čo si dať pozor
Pri AI službách je najčastejší problém nie kompromitácia kontajnera, ale únik dát cez logy, zle nastavené prístupy alebo neúmyselné posielanie citlivých vstupov do externých služieb.
- IAM a servisné účty: každá Cloud Run služba beží pod konkrétnou identitou – dávaj jej len minimálne potrebné oprávnenia (principle of least privilege). Servisný účet pre RAG endpoint nepotrebuje prístup k celému Cloud Storage.
- Privátny vs. verejný endpoint: interné AI služby (prompt router, RAG backend, embedding service) nepublikuj verejne. Nastav ingress na "internal" alebo "internal + load balancer" podľa potreby.
- Autentifikácia requestov: preferuj overenie identity cez Google Identity tokens alebo API Gateway pred jednoduchou "tajnou URL". Na interné volania medzi Cloud Run službami používaj service-to-service autentifikáciu.
- Secrets mimo kódu: API kľúče pre LLM providery a databázové credentials nedávaj do repa ani do Docker image; používaj Secret Manager s automatickou rotáciou.
- Logovanie vstupov: pozor na to, čo loguješ – request body môže obsahovať osobné údaje, interné dokumenty alebo prompt šablóny, ktoré sú citlivé. Nastav si explicitné pravidlo "čo sa smie logovať" a audit to.
- Regionálne spracovanie dát: vyber región vedome – kvôli GDPR a iným reguláciám. Európske dáta by mali zostať v európskych regiónoch; Cloud Run to technicky umožňuje, ale musíš to explicitne nakonfigurovať.
- Zraniteľnosti v závislotiach: kontajnerový obraz pravidelne rebuilduj a skenuj (napr. Artifact Registry má vstavaný vulnerability scanning). Pri AI obrazoch s veľkými ML knižnicami to je obzvlášť dôležité – numpy, transformers, CUDA drivery majú vlastné bezpečnostné cykly.
Odporúčanie: nastav si v tíme checklistu pre každé nové Cloud Run nasadenie – min. ingress policy, servisný účet, secret management, logging policy. Päť minút prevencie ušetrí hodiny debugovania produkčného incidentu.
8. Praktické tipy a kedy to použiť
Cloud Run je výborný vtedy, keď chceš rýchlo zmeniť nápad na URL, ktoré je schopné prežiť reálnu prevádzku. Pri AI to často znamená: "mám pipeline a potrebujem ju zverejniť ako škálovateľnú službu."
Vhodné použitia:
- AI gateway / orchestrácia: Cloud Run prijme request, spraví validáciu, zavolá model (Gemini, Claude, GPT alebo vlastný), post-process a vráti výsledok.
- RAG servis: endpoint riešiaci chunking, embeddingy, vyhľadávanie a skladanie kontextu – model voláš až na konci pipeline.
- Streaming inference: progresívne posielanie tokenov priamo do frontendu cez SSE bez bufferovania celej odpovede.
- Webhooky a automatizácie: spracovanie eventov (nový dokument, správa v Pub/Sub) a spúšťanie AI workflow.
- A/B testovanie promptov: traffic split medzi revíziami umožňuje porovnať nové prompt šablóny bez zmeny URL alebo klientského kódu.
- "Thin" inference bez vlastného modelu: ak nehostuješ model u seba a voláš externý provider, Cloud Run je ideálny bez akejkoľvek špeciálnej konfigurácie.
- Lokálna AI inferencia s L4 GPU: menšie open-source modely (do cca 14B) s dobrou latenciou, bez závislosti na externom API.
Kedy nie:
- Extrémne dlhé výpočty bez HTTP checkpointov: ak trvá výpočet hodiny, použi Cloud Run Jobs alebo Vertex AI Pipelines.
- Veľké modely (70B+): L4 GPU nie je dostačujúci; potrebuješ GKE s A100/H100 alebo Vertex AI Endpoints.
- Stabilný vysoký load 24/7: pri 100% vyťaženosti bez škálovacích výhod môže byť lacnejší GKE alebo VM s rezervovanou kapacitou.
Tipy, ktoré šetria nervy aj peniaze:
- Štíhly image: menší kontajner = rýchlejší cold start. Používaj multi-stage Docker build a odstraňuj dev závislosti.
- Graceful shutdown: pri škálovaní dole Cloud Run pošle SIGTERM; spracuj ho tak, aby si dokončil rozrobenú požiadavku alebo ju vrátil do fronty.
- Idempotencia: pri eventoch a retry mechanizmoch sa môže úloha spustiť viackrát – navrhni API tak, aby opakované volanie neublížilo.
- Cache embedingov a výsledkov: pri RAG je cache najlacnejší performance boost; uvažuj o Redis (Memorystore) alebo jednoduchom in-memory cache pre frekventované dotazy.
- Monitoring latencie: pri AI je latencia priamo používateľský zážitok; sleduj p95 a p99, nie len priemer. Cloud Monitoring má na to vstavaný support.
- Minimálne inštancie selektívne: nastav min=1 len pre kritické produkčné endpointy, nie pre každý service – cold start na interných službách zvyčajne nevadí.
Zhrnutie
- Cloud Run je najjednoduchší spôsob, ako spraviť z kontajnera škálovateľnú URL službu – bez správy serverov, s automatickým škálovaním na nulu.
- Pre AI hrá rolu lepidla medzi frontendom, modelmi a dátami: gateway, RAG servis, streaming inference, event-driven spracovanie dokumentov.
- GPU podpora (NVIDIA L4) od roku 2025 z neho robí aj platformu pre priamu inferenciu menších open-source modelov – bez Kubernetes a bez vlastnej VM infraštruktúry.
- Integrácia s GCP ekosystémom (Vertex AI, AlloyDB, Pub/Sub, Secret Manager) je silná stránka – ak si na Google Cloud, Cloud Run do toho zapadne prirodzene.
- Najčastejšie riziká sú zle nastavené prístupy a únik dát cez logy – chráň endpointy, používaj minimálne oprávnenia, explicitne definuj čo sa smie logovať.
- Kľúčové architektonické rozhodnutia sú cold start stratégia, streaming vs. polling pre dlhé úlohy a GPU vs. API inferencia – tieto voľby priamo ovplyvňujú latencii, cenu aj zložitosť.