Paikallisen tekoälyn päivälehti — avoimen painon mallit, työkalut ja rauta

Perjantai 21. elokuuta 2026Aamupainos · klo 7Nro 14

← Takaisin numeroon 14

Työkalut · Ollama-päivitys

Ollama v0.32.15 julkaistiin, joka puolittaa mallin ensimmäisen tokenin viiveen

Uusi versio v0.32.15 julkaistiin 20.8.2026. Päivitys tuo mukanaan merkittäviä suorituskykyparannuksia mallien latausnopeuteen [1].

Ollama v0.32.15 julkaistiin, joka puolittaa mallin ensimmäisen tokenin viiveen Ennen päivitystä TTFT 995 ms Päivityksen jälkeen TTFT 524 ms TTFT-viiveen lasku päivityksessä

Ollama on julkaissut version v0.32.15, joka sisältää useita suorituskykyyn vaikuttavia muutoksia [1]. Päivityksessä on korjattu virheitä ja päivitetty riippuvuuksia [1].

Mallien metatiedot välimuistissa säilytetään nyt pyyntöjen välillä [1]. Tämä laskee ensimmäisen tokenin viiveen (TTFT) noin 995 millisekunnista noin 524 millisekuntiin [1].

Päivitys tuo myös uuden työnaloitusprosessin työpöytäkäyttöön ensimmäisen käynnistyksen yhteydessä [1]. Lisäksi Qwen 3.8 -mallien järjestelmäviestit on nyt normalisoitu [1].

Ohjelmiston taustalla on tehty muutoksia MLX- ja llama.cpp-riippuvuuksiin [1]. Versio on julkaistu GitHubissa 19.8.2026 [1].

Päivitys korjaa virheen, jossa chat- ja generate-toiminnot saattoivat jumiutua kesken suorituksen tapahtuvan parserivirheen vuoksi [1].

Käyttäjien kannattaa päivittää Ollama-asennus välittömästi hyödyntääkseen uutta nopeutta ja korjattuja toimintoja [1].

Lähteet