Paikallisen tekoälyn päivälehti — avoimen painon mallit, työkalut ja rauta

Tiistai 25. elokuuta 2026Aamupainos · klo 7Nro 18

← Takaisin numeroon 18

Työkalut · Llama.cpp päivitys

Llama.cpp b10615 tuo Metal-pohjaisen Flash-Attention-optimoinnin Apple-laitteille

Llama.cpp-projektiin on julkaistu b10615-versio 24.8.2026 [1]. Päivitys sisältää uusia optimointeja Metal-rajapinnan Flash-Attention-vektoreille [1].

Llama.cpp b10615 tuo Metal-pohjaisen Flash-Attention-optimoinnin Apple-laitteille Flash-Attention vektorien määrän kasvu 133 kpl Vektorien määrä (f16)

Llama.cpp-ohjelmistoon on julkaistu uusi b10615-versio 24.8.2026 [1]. Päivitys keskittyy erityisesti Metal-rajapinnan Flash-Attention-vektorien optimointiin [1].

Kehittäjät ovat lisänneet 53 uutta f16-instanssia (Q, NE) Flash-Attention-vektoreille [1]. Tämä nostaa vektorien määrän 80:stä 133:een [1].

Päivityksessä on otettu käyttöön uusi tuning-taulukko ja dispatch-kytkentä Flash-Attention-vektoreille [1]. Lisäksi on lisätty SMEM cap fallback -mekanismi [1].

Optimointi koskee myös kvantisoituja KV-välimuisteja (quantized KV caches) [1]. Kehittäjät ovat laajentaneet Flash-Attention-vektorien hienosäätöä tähän tarkoitukseen [1].

Uusi työkalu mahdollistaa Flash-Attention-vektorien (Q, NE) skannauksen, pakkauksen ja taulukon tuottamisen [1]. Työkalu tukee myös laitteetason tunnistusta offline-hienosäädössä [1].

Hienosäätö on laajennettu kattamaan myös M1 Pro, M2 Ultra ja M5 Max -laitteet [1]. Käyttäjien kannattaa päivittää ohjelmisto hyödyntääkseen nämä laitteistokohtaiset suorituskykyparannukset [1].

Lähteet