Paikallisen tekoälyn päivälehti — avoimen painon mallit, työkalut ja rauta

Maanantai 24. elokuuta 2026Aamupainos · klo 7Nro 17

← Takaisin numeroon 17

Työkalut

ExLlamaV3 versio 1.4.3 tuo tukea GLM 5.2 -malleille ja uusia optimointivaihtoehtoja

ExLlamaV3-ajomoottori on päivittänyt version 1.4.3. Päivitys sisältää useita uusia ominaisuuksia ja parannuksia suorituskykyyn [1].

ExLlamaV3 versio 1.4.3 tuo tukea GLM 5.2 -malleille ja uusia optimointivaihtoehtoja Versio 1.4 ExLlamaV3 version 1.4.3 ominaisuudet

ExLlamaV3-ajomoottori on julkaissut version 1.4.3, joka sisältää tukea GLM 5.2 -malleille [1]. Tämä tuki on vielä kehitysvaiheessa [1].

Päivityksessä on tuotu mukaan osittainen CPU-kerrosten asiantuntijoiden offloading-vaihtoehto dynaamisella sijoittelulla [1]. Tämä korvaa aiemman asiantuntijavälimuistin (expert cache) [1].

Uusi kokeellinen kvantisointi-optimointiputki on lisätty osaksi ohjelmistoa [1]. Lisäksi tekstin upotus keskelle generointia on mahdollista, mikä mahdollistaa päättelytokenien budjetin käytön [1].

Taustalla on pyrkimys parantaa muistinhallintaa ja suorituskykyä. Päivitys sisältää myös tarkemman autosplit-allokaation [1].

VRAM-käyttö on vähentynyt DSA-prefill-vaiheessa ja se on nyt vakaalla tasolla [1]. Lisäksi CPU-välimuistin offloading on tuettu TP-tilassa [1].

Käyttäjien kannattaa päivittää ExLlamaV3 versioon 1.4.3, jos hyödynnät GLM-malleja tai tarvitset parempaa VRAM-hallintaa [1].

Lähteet