Назад в каталог

UD Tatar-NMCTT

Размеченный корпус татарского языка в международном формате Universal Dependencies.

github.com

Коротко о проекте

  • Корпус вручную размечен в рамках проекта NAIST Multilingual Corpus
  • Основой стали новостные тексты издания «Татар-информ»
  • Данные опубликованы в формате CoNLL-U с открытой историей изменений

Fastmorph

Языковой проект#Язык#Технологии#Языковая модель#Открытый исходный кодтатары
  • Создан для Корпуса письменного татарского языка
  • Ищет по словоформам, леммам, грамматическим тегам и шаблонам
  • Поддерживает условия расстояния между словами
  • Исходный код опубликован по лицензии GPL-3.0
Подробнее

Ilshat Säetov

АвторЯзыковой проект#Лингвист#Язык#Литература#Технологии#Клавиатура#Распознавание текста#Открытый исходный кодтатары
  • Ассоциированный сотрудник CETOBaC при EHESS в Париже
  • Автор TATlit - языковой модели для литературного татарского
  • Автор OCR-модели для татарской кириллицы и раскладки клавиатуры для macOS
Подробнее

Нейротатарлар

Языковой проект#Язык#Общество#Технологии#Распознавание речи#Открытый исходный кодтатары
  • 14 репозиториев на GitHub, включая кураторский список «awesome-tatar»
  • Разрабатывает приложение «yazam.tatar» для проверки грамматики
  • Цель - крупнейший открытый корпус татарских текстов для обучения языковых моделей
Подробнее
Муэллиф