Назад в каталог

Tweety Tatar 7B

Открытая языковая модель на 7 млрд параметров с нативным токенизатором для татарского языка, часть исследовательской серии Tweeties для малоресурсных языков.

huggingface.co

Коротко о проекте

  • Создана международной исследовательской группой по многоязычному NLP
  • Адаптирована через trans-tokenization с дообучением на татарском корпусе
  • В серии есть также специализированные версии модели

Aigiz Kunafin

АвторЯзыковой проект#Разработчик#Язык#Технологии#Синтез речи#Языковая модельбашкирытатары
  • Опубликовал 19 моделей и 13 датасетов на Hugging Face для башкирской и татарской речи
  • Автор инструментов bashspell, bashkort_translate_bot, bashkir-stress
  • Победитель Enterprise RAG Challenge
Подробнее

Fastmorph

Языковой проект#Язык#Технологии#Языковая модель#Открытый исходный кодтатары
  • Создан для Корпуса письменного татарского языка
  • Ищет по словоформам, леммам, грамматическим тегам и шаблонам
  • Поддерживает условия расстояния между словами
  • Исходный код опубликован по лицензии GPL-3.0
Подробнее

Письменный корпус татарского языка

Языковой проект#Язык#Технологии#Языковая модельтатары
  • Корпус содержит сотни миллионов татарских слов
  • Поддерживает поиск по словоформам и грамматическим признакам
  • Включает тезаурус и сервис проверки правописания
Подробнее
Муэллиф