Työkalut · SGLang-päivitys
SGLang v0.5.18 tuo merkittäviä nopeusparannuksia mallien lataukseen ja päättelyyn
Uusi versio v0.5.18 julkaistiin 24.8.2026. Päivitys sisältää useita uusia malleja ja optimointeja suorituskyvylle [1].
SGLang-ajomoottori on julkaissut version v0.5.18, joka sisältää 710 pullopyyntöä (PR) 212 kehittäjältä [1]. Päivitys tuo mukanaan useita uusia malleja, kuten Muse Glimmer, Intern-S2-Mobius, SANA-Video, LingBot-Video-MoE, LTX-2.5 sekä Cosmos3 Edge & Distilled [1].
Uusi ominaisuus mahdollistaa checkpoint-sivujen lataamisen taustalla samalla kun CUDA-graafit kaapatuun [1]. Tämä nopeuttaa Qwen3-32B-mallin latausta H100-laitteistolla 8,6–11,7 % verrattuna sarjalliseen lataukseen [1].
Latausnopeus voi olla jopa 2,38-kertainen verrattuna tavalliseen oletusasetukseen, jolloin aika lyhenee 84,8 sekunnista 35,6 sekuntiin [1]. Tämä on mahdollista käyttämällä --startup-weight-load-mode overlap -asetusta [1].
Päivitys tuo myös optimointeja TP LMHead -toiminnallisuuteen, jossa allgather- ja scatter-operaatiot yhdistetään yhdeksi all-to-all-operaatioksi [1]. DeepSeek-V4-Pro B200 -laitteistolla LMHead-aika laskee 320 mikrosekunnista 169 mikrosekuntiin [1].
TPOT-aika paranee DeepSeek-V4-Pro B200 -laitteistolla 35,67 millisekuntiin 36,97 millisekunnista [1]. Lisäksi FlashInfer MNNVL -tuki parantaa DeepSeek-V4-Flash TP4 -päättelyä Blackwell-laitteistolla jopa 6,9 % pienillä eräkoolla [1].
Käyttäjien kannattaa päivittää SGLang-ajomoottori, jos käytössä on uudempi Blackwell- tai H100-laitteisto, jotta voidaan hyödyntää uudet lataus- ja päättelyoptimoinnit [1]. NVFP4-tarkkuus on nyt käytettävissä myös AMD-laitteistolla --quantization quark_mx -asetuksella [1].