Infrastruktura AI i LLM
Inferencja pod Twoją kontrolą.
Projektuję warstwę, na której działają modele językowe: klastry GPU, kolejki SLURM, serwowanie przez vLLM i llama.cpp oraz wspólne API w LiteLLM.
01 / szybsza inferencja
~7x
konkretne środowisko
02 / kolejki zadań
SLURM
współdzielone GPU
03 / wiele silników
1 API
LiteLLM
00 / Pytania przed wyceną
01Jaki model i kwantyzacja mają działać?
02Jaka długość kontekstu i ile równoległych żądań?
03Czy dane mogą opuścić firmę?
04Czy GPU obsługują inferencję, trening czy oba typy zadań?
01 / Zakres
Co obejmuje praca
Projekt zaczynam od modelu, długości kontekstu, charakteru ruchu i akceptowalnego czasu odpowiedzi, a nie od zakupu GPU.
Benchmark
Pomiar modelu, wielkości paczki, kontekstu i wykorzystania GPU.
latencja / przepustowość / VRAM
Architektura GPU
Dobór akceleratorów, pamięci, sieci i przestrzeni dyskowej do obciążenia.
GPU / VRAM / łącza
Kolejki zadań
Współdzielenie zasobów i priorytety między zespołami.
SLURM / kolejki zadań
Serwowanie modeli
Inferencja online, grupowanie żądań, pamięć podręczna i skalowanie silników.
vLLM / llama.cpp
Warstwa API
Jedno wejście do modeli lokalnych i zewnętrznych.
LiteLLM / routing / limity
Monitoring
GPU, kolejki, latencja, błędy i wykorzystanie tokenów.
Prometheus / Grafana
02 / Potwierdzony wynik / CV
Inferencja około siedem razy szybsza po optymalizacji stosu.
Wynik osiągnięto przez dopasowanie sposobu serwowania do modelu i sprzętu. Nie wynikał z samej wymiany GPU. Każdy projekt zaczynam od pomiaru wydajności i zapisuję jego warunki.
OGRANICZENIE / Nie obiecuję tego samego mnożnika bez pomiaru konkretnego modelu, sprzętu i ruchu.
- szybsza inferencja
- ~7x
- silnik serwowania
- vLLM
- zarządzanie zasobami
- SLURM
03 / Protokół
Jak wygląda wdrożenie
- 01
Pomiar
Model, kwantyzacja, kontekst, wielkość paczki i profil GPU.
- 02
Architektura
GPU, pamięć, sieć, dyski i model kolejkowania.
- 03
Wdrożenie
SLURM, vLLM, llama.cpp, LiteLLM i monitoring.
- 04
Odbiór
Test obciążenia, procedury i dokumentacja parametrów.
05 / Granica
AI oznacza tu konkretną warstwę infrastruktury.
Zakres tej usługi to serwowanie modeli, kolejki, API i monitoring. Dobór modelu do procesu biznesowego może być częścią analizy, ale rdzeniem pozostaje mierzalne i niezawodne środowisko wykonawcze.
Zapytanie
Opisz stan obecny, nie rozwiązanie.
Napisz, co dziś nie działa, jaka jest skala środowiska i co już próbowaliście. Odpowiem osobiście.
Powiązane obszary
Kto to robi
inżynier infrastruktury IT, w zawodzie od 2017
Rozmawiasz z osobą, która potem konfiguruje środowisko. Bez warstwy handlowej i bez podwykonawców.