Työkalut · Ollama-päivitys
Ollama v0.32.15 julkaistiin, joka puolittaa mallin ensimmäisen tokenin viiveen
Uusi versio v0.32.15 julkaistiin 20.8.2026. Päivitys tuo mukanaan merkittäviä suorituskykyparannuksia mallien latausnopeuteen [1].
Ollama on julkaissut version v0.32.15, joka sisältää useita suorituskykyyn vaikuttavia muutoksia [1]. Päivityksessä on korjattu virheitä ja päivitetty riippuvuuksia [1].
Mallien metatiedot välimuistissa säilytetään nyt pyyntöjen välillä [1]. Tämä laskee ensimmäisen tokenin viiveen (TTFT) noin 995 millisekunnista noin 524 millisekuntiin [1].
Päivitys tuo myös uuden työnaloitusprosessin työpöytäkäyttöön ensimmäisen käynnistyksen yhteydessä [1]. Lisäksi Qwen 3.8 -mallien järjestelmäviestit on nyt normalisoitu [1].
Ohjelmiston taustalla on tehty muutoksia MLX- ja llama.cpp-riippuvuuksiin [1]. Versio on julkaistu GitHubissa 19.8.2026 [1].
Päivitys korjaa virheen, jossa chat- ja generate-toiminnot saattoivat jumiutua kesken suorituksen tapahtuvan parserivirheen vuoksi [1].
Käyttäjien kannattaa päivittää Ollama-asennus välittömästi hyödyntääkseen uutta nopeutta ja korjattuja toimintoja [1].