Koodi · Python-kirjasto
Tokenizers-kirjasto tarjoaa nopean tavan tekstin käsittelyyn Rust-pohjaisella toteutuksella
Tokenizers-kirjaston versio 0.23.1 on julkaistu 27.4.2026 [1]. Kirjasto tarjoaa nopean tavan kouluttaa uusia sanastoja ja suorittaa tokenisointia.
Tokenizers-kirjasto tarjoaa toteutuksen nykyisin käytetyimmille tokenizer-malleille [1]. Se on suunniteltu sekä tutkimuskäyttöön että tuotantoon [1].
Kirjasto on erittäin nopea, sillä se hyödyntää Rust-pohjaista toteutusta [1]. Palvelimen CPU:lla voi tokenisoida yhden gigatavun tekstiä alle 20 sekunnissa [1].
Paikallisen ajon kannalta kirjasto on merkittävä, koska se hoitaa esikäsittelyn, kuten tekstin katkaisun, täyttämisen ja erikoismerkkien lisäämisen [1]. Se tukee myös neljää valmiiksi tehtyä tokenizeria, kuten Bert WordPiece ja kolme yleisintä BPE-versiota [1].
Taustalla toimii HuggingFacen kehittämä kirjasto, jonka korkean tason suunnittelu perustuu Rust-kieleen [1]. Kirjasto mahdollistaa myös normalisoinnin, jossa on mukana alignment-seuranta [1].
Kirjaston avulla on mahdollista saada alkuperäisestä lauseesta se osa, joka vastaa tiettyä tokenia [1]. Tämä helpottaa tekstin ja mallin syötteen välistä yhteyttä [1].
Lukijan kannattaa hyödyntää tätä kirjastoa, jos tarvitaan suorituskykyä vaativaa tekstin esikäsittelyä paikallisesti [1]. Kirjasto on helposti asennettavissa pip-paketilla [1].