Данные: корпуса и словари даргинского языка

Всё, что на сайте показано страницами, здесь лежит файлами: параллельные корпуса, словарь говоров, результаты расчётов. Это для тех, кому нужен не текст для чтения, а данные для обработки — лингвистов, разработчиков словарей и переводчиков, авторов языковых моделей.

Условия использования

  • Наши данные — тексты статей сайта, корпус диалектного опроса, матрица близости говоров, результаты расчётов — публикуются по лицензии CC BY 4.0: использовать можно свободно, в том числе для обучения моделей, с указанием источника «mekegi.com» и ссылкой на страницу.
  • Оцифровки чужих изданий — перевод Корана, сказки из «Свода памятников фольклора», «Евгений Онегин» в переводе Рабаданова, словарь Темирбулатовой — остаются под правами авторов и издателей. Мы публикуем оцифровку для исследований и обучения с обязательным указанием источника; коммерческое использование согласуйте с правообладателями.
  • Исправления в корпусах принимаем через форму обратной связи и режим «предложить изменения» на страницах словарей: правки уходят на модерацию и попадают в следующую версию файла.

Каждая карточка ниже размечена как schema.org Dataset, так что данные видны и поисковым системам, и каталогам датасетов.

Параллельные корпуса

Коран на даргинском языке

Полный параллельный корпус: арабский оригинал, даргинский и русский переводы, выровненные по аятам.

  • Формат: CSV, UTF-8, разделитель — запятая. Колонки: сура, аят, арабский оригинал, даргинский перевод, русский перевод. 6236 аятов.
  • Источник: Даргинский текст оцифрован с печатного издания перевода Корана на даргинский язык и выверен вручную; русский перевод — Э. Кулиев. Витрина — /quran/.
  • Лицензия: права на исходный текст принадлежат авторам и издателям; оцифровка публикуется для исследований и обучения с указанием источника, коммерческое использование — с согласия правообладателей
  • Скачать (4.2 МБ), обновлено 2026-08-31

Даргинские волшебные сказки

Параллельный корпус «предложение — перевод» с указанием говора и села записи. Пустая русская колонка — лакуна издания, а не ошибка выравнивания.

  • Формат: CSV, UTF-8, разделитель — вертикальная черта. Колонки: номер, название, диалект, село, абзац, строка, даргинский, русский. Около 1320 пар предложений, 14 сказок.
  • Источник: Свод памятников фольклора народов Дагестана. Т. 2: Волшебные сказки. М.: Наука, 2011. Витрина — /lingvo/folklor/.
  • Лицензия: права на исходный текст принадлежат авторам и издателям; оцифровка публикуется для исследований и обучения с указанием источника, коммерческое использование — с согласия правообладателей
  • Скачать (512 КБ), обновлено 2026-08-27

«Евгений Онегин» на даргинском

Перевод, выровненный с оригиналом строка в строку внутри онегинской строфы. Строфы, где число строк разошлось, в корпус не вошли.

  • Формат: CSV, UTF-8, разделитель — вертикальная черта. Колонки: глава, строфа, строка, даргинский, русский. Около 4450 строк.
  • Источник: А. С. Пушкин, «Евгений Онегин», перевод на даргинский — Сулайбан Рабаданов (Махачкала, 2007). Витрина — /lingvo/onegin/.
  • Лицензия: права на исходный текст принадлежат авторам и издателям; оцифровка публикуется для исследований и обучения с указанием источника, коммерческое использование — с согласия правообладателей
  • Скачать (512 КБ), обновлено 2026-09-02

Словари и говоры

Словарь говоров Темирбулатовой: формы по говорам

Те же данные, что в таблице сравнения говоров: понятие и его формы в каждом из 44 говоров, разложенные по-говорно, чтобы любую комбинацию можно было собрать на клиенте.

  • Формат: JSON. skeleton.json — список понятий (литературная форма и русское значение, около 2450 штук); формы каждого говора — отдельным файлом /dict-compare/parts/<говор>.json с id словарных записей. Список говоров и кодов — в манифесте.
  • Источник: С. М. Темирбулатова, диалектологический словарь даргинского языка: 44 говора, около 46 тысяч словарных фиксаций. Витрины — словари говоров и таблица сравнения.
  • Лицензия: права на исходный текст принадлежат авторам и издателям; оцифровка публикуется для исследований и обучения с указанием источника, коммерческое использование — с согласия правообладателей
  • Скачать (146 КБ), обновлено 2026-09-20

Матрица близости даргинских говоров

Попарная близость говоров по общему ядру понятий. Значения воспроизводятся конвейером статьи с точностью до третьего знака.

  • Формат: NEXUS (для SplitsTree и других филогенетических программ): матрица расстояний между 44 говорами и литературным языком.
  • Источник: Расчёт по словарю Темирбулатовой взвешенным расстоянием Левенштейна; метод и все числа — в статье «Семнадцать названий радуги».
  • Лицензия: CC BY 4.0 — свободно для любых целей с указанием источника «mekegi.com»
  • Скачать (15 КБ), обновлено 2026-09-07

Словарные связи говоров на карте

Данные для карты «словарные связи поверх географии»: для каждого говора ближайшие соседи по словарю с весом связи.

  • Формат: JSON: координаты сёл и сильнейшие словарные связи между ними, как на карте в статье о матрице.
  • Источник: Та же матрица близости; координаты — по карте говоров сайта.
  • Лицензия: CC BY 4.0 — свободно для любых целей с указанием источника «mekegi.com»
  • Скачать (18 КБ), обновлено 2026-09-07

Диалектный опрос

Корпус диалектного опроса 2026

Переводы одних и тех же фраз на разные даргинские говоры. Ответы участников не редактируются: сомнительные ячейки помечены флагами, а не исправлены.

  • Формат: JSON: stimuli — фразы-стимулы, records — анкеты с говором (как его назвал участник), группой говоров и ответами по каждой фразе; поле raw хранит написание участника без правок, qc — флаги проверки качества. Около 400 анкет, 106 стимулов.
  • Источник: Анкеты носителей, собранные через онлайн-формы с марта 2026 года; стимулы — Д. Ганенков. Разбор — в статье о диалектном опросе.
  • Лицензия: CC BY 4.0 — свободно для любых целей с указанием источника «mekegi.com»
  • Скачать (761 КБ), обновлено 2026-09-05