Koodi · Python-kirjasto
TRL-kirjasto mahdollistaa kielimallien vahvistusoppimisen useissa eri ympäristöissä
TRL-kirjaston uusi versio 1.9.2 tuo mukanaan parannuksia agenttimaiseen vahvistusoppimiseen [1]. Päivitys on julkaistu 28.7.2026 [1].
TRL-kirjasto 1.9.2 mahdollistaa kielimallien jälkikoulutuksen vahvistusoppimisen avulla [1]. Uusi GRPOTrainer-ominaisuus tukee nyt esimerkkikohtaista ympäristön valintaa [1].
Päivitys tuo mukanaan myös ympäristön omistamat palkkiot (environment-owned rewards) [1]. Tämä mahdollistaa agenttimaiseen vahvistusoppimiseen liittyvät monimutkaisemmat skenaariot [1].
Kirjasto on suunniteltu peruskoulutettujen mallien (foundation models) jälkikoulutukseen [1]. Se on osa Hugging Face -ekosysteemiä [1].
Paikalliseen ajoon kirjasto liittyy mahdollistamalla mallien hienosäädön suoraan kehittäjän hallinnassa [1]. Se tarjoaa työkaluja mallien suorituskyvyn parantamiseen vahvistusoppimisen avulla [1].
Kirjaston taustalla toimii Hugging Face [1]. Se on avoimen lähdekoodin työkalu, joka on saatavilla GitHubista [1].
Rajoituksia ei ole täysin määritelty, mutta kirjasto vaatii Transformers-kirjaston käyttöä [1]. Käyttäjän tulee huomioida ympäristön hallinta GRPOTrainer-käytössä [1].
Lukijan kannattaa päivittää TRL-kirjasto versioon 1.9.2, jos tarvitaan monimutkaista agenttimaista vahvistusoppimista [1]. Päivitys on saatavilla Hugging Face Hubin kautta [1].