Styr arbetslasten
Konfigurera modellroller för fast, mid, large, vision, CPU och fallback. Inspektera routingbeslut, eskalering och nedväxling när anrop fördelas över tillgänglig kapacitet.
Prestanda
En modellruntime är en del av systemet. Kaldryn tillför routing av arbetslaster, delad inferenskapacitet och mätvärden som hjälper administratörer att förstå svarstid, genomströmning och hårdvarubelastning.
Utforska denna del av plattformenKonfigurera modellroller för fast, mid, large, vision, CPU och fallback. Inspektera routingbeslut, eskalering och nedväxling när anrop fördelas över tillgänglig kapacitet.
Följ tid till första token, tokens per sekund och percentiler för kontextfyllnad. Jämför benchmarkkörningar med resursmätningar och undersök anropsaktivitet mellan användare och modellnivåer.
Se GPU-minne, CPU, lagring och väntande arbete. Hantera modellplacering och GPU-noder i klusterkonsolen med säker nodregistrering, anslutningskontroller och motorkonfiguration.
Interaktiv mjukvaruförhandsvisning · exempeldata
Mät inferensprestanda i er driftsättning.
TTFT p50
180 ms
Tokens / sek
420
Aktiva anrop
32
Mät tid till första token
Baserad på administrationskonsolen i Kaldryn Platform. Funktioner beror på licensnivå, roll, hårdvara och konfiguration.
Genomströmning och samtidighet varierar med modell, kvantisering, kontextlängd, hårdvara och arbetslast. Jämförelsen nedan visar ett försiktigt räkneexempel på 9×; verifiera prestandan med er egen arbetslast.
Se potentialen i delad inferens med ett försiktigt räkneexempel på 9× för 32 samtidiga chattar på GB10-hårdvara.
genomströmningen per användare i detta exempel
Kontinuerlig batchning · delad GPU
Referensnivå för detta räkneexempel
Med 6,3 tokens per sekund och användare jämfört med referensnivån 0,7 blir genomströmningen 9× i exemplet. Över 32 chattar motsvarar det 201,6 jämfört med 22,4 tokens per sekund.
Chatt, dokumentsökning med RAG, agenter och finjustering av modeller samlas i en plattform.
Hantera SSO, rollbaserad åtkomst, DLP och granskningsloggar tillsammans med GPU-hälsa, signerade uppdateringar och backuper i en konsol.
Räkneexempel, inte ett nytt uppmätt benchmark: 0,7 × 9 = 6,3 tokens/s per användare. Referenslast: GB10, Qwen2.5-7B, 8k kontext, svar på 150 tokens, varm motor, 32 samtidiga chattar. Faktisk genomströmning beror på modell, hårdvara och konfiguration.
Diskutera er installation
Diskutera er installation