Hoppa till innehållet
Plattformsöversikt

Prestanda

Behåll snabb AI när teamet växer.

En modellruntime är en del av systemet. Kaldryn tillför routing av arbetslaster, delad inferenskapacitet och mätvärden som hjälper administratörer att förstå svarstid, genomströmning och hårdvarubelastning.

Utforska denna del av plattformen
01

Styr arbetslasten

Konfigurera modellroller för fast, mid, large, vision, CPU och fallback. Inspektera routingbeslut, eskalering och nedväxling när anrop fördelas över tillgänglig kapacitet.

02

Mät upplevelsen

Följ tid till första token, tokens per sekund och percentiler för kontextfyllnad. Jämför benchmarkkörningar med resursmätningar och undersök anropsaktivitet mellan användare och modellnivåer.

03

Använd hårdvaran medvetet

Se GPU-minne, CPU, lagring och väntande arbete. Hantera modellplacering och GPU-noder i klusterkonsolen med säker nodregistrering, anslutningskontroller och motorkonfiguration.

Utforska denna del av plattformen

Kaldryn Platform · Prestanda

Interaktiv mjukvaruförhandsvisning · exempeldata

Prestanda

Mät inferensprestanda i er driftsättning.

Exempeldata · prova funktionerna

TTFT p50

180 ms

Tokens / sek

420

Aktiva anrop

32

Driftmätvärden

Mät tid till första token

Endast demo · inga ändringar i era system

Det här ingår i modulen

  • Genomströmning och svarstider
  • Resursutnyttjande
  • Prestandadiagnostik
  • Mät tid till första token
  • Driftmätvärden per modellnivå
  • Kontextfyllnad p50 och p95
  • Upp- och nedgraderade routingbeslut

Baserad på administrationskonsolen i Kaldryn Platform. Funktioner beror på licensnivå, roll, hårdvara och konfiguration.

Genomströmning och samtidighet varierar med modell, kvantisering, kontextlängd, hårdvara och arbetslast. Jämförelsen nedan visar ett försiktigt räkneexempel på 9×; verifiera prestandan med er egen arbetslast.

Mer från samma GPU

Mer arbete. Samma hårdvara.

Se potentialen i delad inferens med ett försiktigt räkneexempel på 9× för 32 samtidiga chattar på GB10-hårdvara.

0×

genomströmningen per användare i detta exempel

Inuti Kaldryn Engine
Exempel: tokens per sekund och användare
GB10 · 0 samtidiga chattar
Kaldryns motor

Kontinuerlig batchning · delad GPU

0,0tok/s
Standard-Ollama

Referensnivå för detta räkneexempel

0,0tok/s
Räkneexempel · 32 samtidiga chattar · GB10
01

Prestanda för delad användning

Med 6,3 tokens per sekund och användare jämfört med referensnivån 0,7 blir genomströmningen 9× i exemplet. Över 32 chattar motsvarar det 201,6 jämfört med 22,4 tokens per sekund.

02

En arbetsyta redo för medarbetarna

Chatt, dokumentsökning med RAG, agenter och finjustering av modeller samlas i en plattform.

03

Administration ingår

Hantera SSO, rollbaserad åtkomst, DLP och granskningsloggar tillsammans med GPU-hälsa, signerade uppdateringar och backuper i en konsol.

Räkneexempel, inte ett nytt uppmätt benchmark: 0,7 × 9 = 6,3 tokens/s per användare. Referenslast: GB10, Qwen2.5-7B, 8k kontext, svar på 150 tokens, varm motor, 32 samtidiga chattar. Faktisk genomströmning beror på modell, hårdvara och konfiguration.

Inuti modulerna

ModellerVälj, installera och kör modeller i er egen infrastruktur.Visa funktioner
  • Modellbibliotek och hårdvarurådgivare
  • Drift på CPU och GPU
  • Modellernas livscykel och tillitsinformation
  • Sök och filtrera modellkatalogen
  • Krav på minne och kontext
  • Standardmodell per nivå
  • Importera lokala modellfiler och GGUF
AnalysFölj användning, prestanda och resursförbrukning.Visa funktioner
  • Modell- och användaraktivitet
  • Tokenförbrukning och svarstider
  • Användningstrender och rapportering
  • Jämför 7, 30 och 90 dagar
  • Daglig molnkostnadsuppskattning med prisantagande
  • Anrop per modellnivå
  • Aktivitetskarta per timme och användaröversikt
GPU-klusterHantera beräkningskapacitet på era egna noder.Visa funktioner
  • Nodregistrering och hälsa
  • Modellplacering
  • Överblick över GPU-resurser
  • Engångstoken för nodregistrering
  • Secure Node Link med mTLS
  • Antal GPU:er och tensorparallell storlek
  • Pinga, optimera och koppla bort noder
HårdvaraSe resurserna som era AI-arbetslaster är beroende av.Visa funktioner
  • CPU, minne och lagring
  • GPU-översikt
  • Övervakning av apparatens resurser
  • GPU-val per nod
  • Använt och tillgängligt VRAM
  • Aktiva och väntande anrop
  • GPU-klockor och resurshistorik
PrestandaMät inferensprestanda i er driftsättning.Visa funktioner
  • Genomströmning och svarstider
  • Resursutnyttjande
  • Prestandadiagnostik
  • Mät tid till första token
  • Driftmätvärden per modellnivå
  • Kontextfyllnad p50 och p95
  • Upp- och nedgraderade routingbeslut

Diskutera er installation

Diskutera er installation