Infrastruktura AI i LLM

Inferencja pod Twoją kontrolą.

Projektuję warstwę, na której działają modele językowe: klastry GPU, kolejki SLURM, serwowanie przez vLLM i llama.cpp oraz wspólne API w LiteLLM.

01 / szybsza inferencja

~7x

konkretne środowisko

02 / kolejki zadań

SLURM

współdzielone GPU

03 / wiele silników

1 API

LiteLLM

00 / Pytania przed wyceną

01Jaki model i kwantyzacja mają działać?

02Jaka długość kontekstu i ile równoległych żądań?

03Czy dane mogą opuścić firmę?

04Czy GPU obsługują inferencję, trening czy oba typy zadań?

01 / Zakres

Co obejmuje praca

Projekt zaczynam od modelu, długości kontekstu, charakteru ruchu i akceptowalnego czasu odpowiedzi, a nie od zakupu GPU.

01

Benchmark

Pomiar modelu, wielkości paczki, kontekstu i wykorzystania GPU.

latencja / przepustowość / VRAM

02

Architektura GPU

Dobór akceleratorów, pamięci, sieci i przestrzeni dyskowej do obciążenia.

GPU / VRAM / łącza

03

Kolejki zadań

Współdzielenie zasobów i priorytety między zespołami.

SLURM / kolejki zadań

04

Serwowanie modeli

Inferencja online, grupowanie żądań, pamięć podręczna i skalowanie silników.

vLLM / llama.cpp

05

Warstwa API

Jedno wejście do modeli lokalnych i zewnętrznych.

LiteLLM / routing / limity

06

Monitoring

GPU, kolejki, latencja, błędy i wykorzystanie tokenów.

Prometheus / Grafana

02 / Potwierdzony wynik / CV

Inferencja około siedem razy szybsza po optymalizacji stosu.

Wynik osiągnięto przez dopasowanie sposobu serwowania do modelu i sprzętu. Nie wynikał z samej wymiany GPU. Każdy projekt zaczynam od pomiaru wydajności i zapisuję jego warunki.

OGRANICZENIE / Nie obiecuję tego samego mnożnika bez pomiaru konkretnego modelu, sprzętu i ruchu.

szybsza inferencja
~7x
silnik serwowania
vLLM
zarządzanie zasobami
SLURM

03 / Protokół

Jak wygląda wdrożenie

  1. 01

    Pomiar

    Model, kwantyzacja, kontekst, wielkość paczki i profil GPU.

  2. 02

    Architektura

    GPU, pamięć, sieć, dyski i model kolejkowania.

  3. 03

    Wdrożenie

    SLURM, vLLM, llama.cpp, LiteLLM i monitoring.

  4. 04

    Odbiór

    Test obciążenia, procedury i dokumentacja parametrów.

05 / Granica

AI oznacza tu konkretną warstwę infrastruktury.

Zakres tej usługi to serwowanie modeli, kolejki, API i monitoring. Dobór modelu do procesu biznesowego może być częścią analizy, ale rdzeniem pozostaje mierzalne i niezawodne środowisko wykonawcze.

Zapytanie

Opisz stan obecny, nie rozwiązanie.

Napisz, co dziś nie działa, jaka jest skala środowiska i co już próbowaliście. Odpowiem osobiście.

Napisz do mnie

Kto to robi

Piotr Ambroziak

inżynier infrastruktury IT, w zawodzie od 2017

Rozmawiasz z osobą, która potem konfiguruje środowisko. Bez warstwy handlowej i bez podwykonawców.

kontakt@ambro.dev