Tweety Tatar 7B
An open 7-billion-parameter language model with a native tokenizer for Tatar, part of the Tweeties research series for low-resource languages.
About this project
- Created by an international multilingual-NLP research group
- Adapted via trans-tokenization and fine-tuned on a Tatar corpus
- The series also includes specialized model variants