# OPCJE INFRASTRUKTURY GPU dla AI Visual — Vilmax Cockpit **Data:** 2026-08-28 **Założenie wolumenu:** 100 produktów/mies × 15 ujęć × 10 kolorów = **15 000 wygenerowań/mies** (paritet z Bobochic: 10 kolorów × 15 zdjęć per produkt) **Źródła cen:** `docs/PROGRESS.md` §13.6 (Kling $0.112/s), ceny fal.ai/RunPod/OpenAI (ogólna wiedza, zakresy) --- ## Opcja 1: Cloud API (fal.ai, RunComfy, OpenAI) Pay-per-use, zero capex, skalowalne. Modele zarządzane przez dostawcę (BiRefNet, FLUX, Kling). | Kryterium | Wartość | |---|---| | Koszt miesięczny (15 000 wygenerowań) | FLUX i2i ~$0.04/img → ~$600; RunComfy FLUX ~$0.05/img → ~$750; BiRefNet ~$0.02/img; Kling $0.112/s × 5s × 100 = ~$56. **Razem ~$1 300-1 500/mies** | | Capex | $0 | | Latencja | 5-30s per obraz (fal.ai queue), 10-60s (RunComfy polling co 4s), 30-120s (Kling wideo) | | Kontrola jakości | Black box — model zarządzany, brak dostępu do wag/ControlNet tuning. Ograniczona kontrola (prompt + reference_strength) | | Privacy | Dane (foto mebli z hali) opuszczają fabrykę → chmura dostawcy. Zależne od ToS fal.ai/RunComfy | | Skalowalność | Natychmiastowa (queue autoscale) | | Maintenance | Dostawca utrzymuje modele/infra. Zero ops po stronie Vilmax | | Rekomendacja | **Etap 1 (MVP)** — niski wolumen (~130/mies), zero capex, szybki start. Już wdrożone (Groq + fal.ai + RunComfy) | ## Opcja 2: Cloud GPU (RunPod, Vast.ai, Lambda Labs) Wynajem RTX 4090/A100, $0.30-2/h. Własne modele (ComfyUI local, pełna kontrola workflow). | Kryterium | Wartość | |---|---| | Koszt miesięczny (15 000 wygenerowań) | RTX 4090 ~$0.44/h (RunPod). FLUX ~10-20s/img na 4090 → 15 000 × 15s = ~62h → ~$27/mies compute. Ale cold start + idle. Realistycznie ~$100-300/mies (z idle). A100 ~$1-2/h szybszy ale droższy | | Capex | $0 | | Latencja | 10-20s per obraz (FLUX na 4090), szybszy niż cloud API queue | | Kontrola jakości | Pełna — własny ComfyUI, ControlNet, IP-Adapter, LUT, custom workflow. Tuning wag możliwy | | Privacy | Dane na instancji wynajętej (możliwa izolacja, ale nadal chmura). Lepsza niż Opcja 1 jeśli region UE + no-shared | | Skalowalność | Ręczna (spin up/down instancji). Cold start 2-5 min | | Maintenance | Vilmax utrzymuje ComfyUI, modele, workflow. Wymaga wiedzy DevOps/ML | | Rekomendacja | **Etap 2 (transition)** — gdy wolumen rośnie ale on-prem jeszcze nieopłacalny. Eksperymenty z custom workflow (Realism Lock) | ## Opcja 3: On-prem GPU (RTX 4090 / RTX 5090 w fabryce) Capex ~$10-20k, zero opex poza prądem. Pełna kontrola, dane nie opuszczają fabryki. | Kryterium | Wartość | |---|---| | Koszt miesięczny (15 000 wygenerowań) | Prąd: RTX 4090 ~450W × 62h = ~28 kWh → ~$3-5/mies (PL stawka). Amortyzacja capex $10k / 24 mies = ~$420/mies. **Razem ~$425/mies** (capex rozłożony) | | Capex | ~$10-20k (RTX 4090 $10k, RTX 5090 ~$15-20k, + workstation PSU/chassis) | | Latencja | 10-20s per obraz (jak Opcja 2, lokalnie) | | Kontrola jakości | Pełna — jak Opcja 2, plus fizyczny dostęp, kalibracja monitora/probnika na miejscu | | Privacy | **Maksymalna** — foto mebli z hali NIE opuszczają fabryki. Krytyczne dla prototypów/kolekcji przedpremierowych | | Skalowalność | Ograniczona do 1 GPU (dodać 2. GPU = kolejne $10k). Wymaga planowania capacity | | Maintenance | Vilmax utrzymuje sprzęt + ComfyUI + modele. Wymaga dedykowanej osoby (DevOps/ML) | | Rekomendacja | **Etap 2 (przy pełnym wolumenie 15 000/mies)** — zwraca się w ~7 mies vs Opcja 1 ($1 460 vs $425). Plus privacy (prototypy nie wyciekają) | --- ## TABELA PORÓWNACZA | Kryterium | Cloud API | Cloud GPU | On-prem GPU | |---|---|---|---| | Koszt/mies (15k gen) | ~$1 300-1 500 | ~$100-300 | ~$425 (z amortyzacją) | | Capex | $0 | $0 | ~$10-20k | | Latencja/obraz | 5-60s | 10-20s | 10-20s | | Kontrola jakości | Black box | Pełna | Pełna + fizyczna | | Privacy | Dane opuszczają fabrykę | Chmura (UE możliwa) | **Maksymalna** (lokalnie) | | Skalowalność | Natychmiastowa | Ręczna | Ograniczona (1 GPU) | | Maintenance | Zero | Średnie | Wysokie (sprzęt + ML) | | Czas startu | Natychmiast | 2-5 min cold start | Stałe (zawsze gotowe) | --- ## REKOMENDACJA DLA VILMAX | Etap | Infra | Uzasadnienie | |---|---|---| | **Etap 1 (MVP)** | **Cloud API** (fal.ai, RunComfy, Groq) | Niski wolumen (~130/mies), zero capex, szybki start. Już wdrożone. | | **Etap 2 (transition)** | **Cloud GPU** (RunPod RTX 4090) | Eksperymenty z Realism Lock, custom workflow, LUT. Wolumen rośnie ale on-prem jeszcze nieopłacalny. | | **Etap 2 (pełny wolumen 15 000/mies)** | **On-prem GPU** (RTX 4090 w fabryce) | Zwraca się w ~7 mies vs cloud API. Privacy: prototypy/kolekcje nie wyciekają. Pełna kontrola kalibracji. | | **Etap 3** | On-prem + Cloud API (hybryda) | On-prem dla produkcji wizualnej, cloud API dla spike'ów (Kling wideo, LLM copy) | **Kluczowa decyzja:** Czy foto mebli z hali (prototypy, kolekcje przedpremierowe) mogą opuszczać fabrykę? Jeśli NIE → on-prem GPU w Etapie 2 jest koniecznością, nie tylko optymalizacją kosztów.