Työkalut
ExLlamaV3 versio 1.4.3 tuo tukea GLM 5.2 -malleille ja uusia optimointivaihtoehtoja
ExLlamaV3-ajomoottori on päivittänyt version 1.4.3. Päivitys sisältää useita uusia ominaisuuksia ja parannuksia suorituskykyyn [1].
ExLlamaV3-ajomoottori on julkaissut version 1.4.3, joka sisältää tukea GLM 5.2 -malleille [1]. Tämä tuki on vielä kehitysvaiheessa [1].
Päivityksessä on tuotu mukaan osittainen CPU-kerrosten asiantuntijoiden offloading-vaihtoehto dynaamisella sijoittelulla [1]. Tämä korvaa aiemman asiantuntijavälimuistin (expert cache) [1].
Uusi kokeellinen kvantisointi-optimointiputki on lisätty osaksi ohjelmistoa [1]. Lisäksi tekstin upotus keskelle generointia on mahdollista, mikä mahdollistaa päättelytokenien budjetin käytön [1].
Taustalla on pyrkimys parantaa muistinhallintaa ja suorituskykyä. Päivitys sisältää myös tarkemman autosplit-allokaation [1].
VRAM-käyttö on vähentynyt DSA-prefill-vaiheessa ja se on nyt vakaalla tasolla [1]. Lisäksi CPU-välimuistin offloading on tuettu TP-tilassa [1].
Käyttäjien kannattaa päivittää ExLlamaV3 versioon 1.4.3, jos hyödynnät GLM-malleja tai tarvitset parempaa VRAM-hallintaa [1].