Семнадцать названий радуги: компьютер измерил расстояния между 44 даргинскими говорами
Сколькими способами можно назвать радугу по-даргински? Диалектологический
словарь даёт ответ: как минимум семнадцатью. Большинство говоров держится
вариаций общего корня — акушинское и мекегинское зурхIяб, цудахарское
цухIяб, урахинское дзубхIяр, ицаринское цIиххяб. Но Губден называет
радугу тIурши, Кадар — шулхIи, в Карацане и Баршамае это «столб»:
ирхIяа тIал и рихIялла тIал, а кубачинцы говорят целой фразой —
чяххярилла мукаче. Одно небесное явление — и почти вся история расхождения
даргинских диалектов в миниатюре.
Слова вроде «радуги» лингвисты собирают в диалектологические словари. А если
такой словарь оцифрован, с ним можно сделать то, что вручную заняло бы месяцы:
сравнить каждый говор с каждым — по всем словам сразу — и посчитать, кто
кому насколько близок. Мы это сделали. Ниже — матрица близости 44 говоров,
дерево их родства, место мекегинского на этой карте и рейтинг расстояний до
литературного даргинского.
Откуда данные
Основа — «Дарган мезла диалектологияла словарь» (диалектологический словарь
даргинского языка) С. М. Темирбулатовой: 575 страниц, где каждое понятие
расписано по десяткам говоров. Мы давно оцифровали его для
словарного раздела сайта — по каждому из 44 говоров на сайте
есть отдельная страница, от акушинского до
кубачинского и
мекегинского.
В оцифрованном виде словарь выглядит так: 40 933 записи, каждая — тройка
«литературное слово — форма говора — русское значение», плюс список говоров,
где эта форма встречается. После группировки получается 2 445 понятий,
и почти каждое расписано по большинству говоров: в среднем у пары говоров
1 604 общих понятия (минимум — 1 097). Для статистики этого более чем
достаточно — сравнение опирается не на список Сводеша из сотни слов, как
классическая лексикостатистика, а на полторы тысячи параллельных лексем.
Как считали
Все формы приводились к единому виду: палочка — к латинской I, снимались
знаки долготы, йотированные записи сводились в одну («ю» и «йу» в разных
говорах записаны по-разному — для сравнения это одно и то же, а йецIал и
ецIал — одно слово). Затем формы разбивались на графемы, где один сегмент —
это один звук, а не одна буква: диграфы кI, гъ, хь, аффрикаты дз и
дж, лабиализованные согласные гв, кв, гьв, кьв, хIв, а также
геминаты — удвоенные согласные южных говоров (кк, тт, цц и даже
удвоенные диграфы вроде хIхI и хьхь): в харбукском ккуртта «лиса»
(лит. гурда) сегментов не семь, а пять. Близость двух форм — нормированное
расстояние Левенштейна:
1 минус доля правок, которыми одна форма превращается в другую. Совпадение —
1.0, ничего общего — около нуля. Когда у говора записано несколько вариантов
слова, наборы вариантов сравниваются симметрично: для каждого варианта
одного говора берётся лучшее соответствие в другом, и наоборот, а результаты
усредняются. Это принципиально: у говоров словарь расписан с разной полнотой,
и простая мера «лучшая пара из всех вариантов» дарила бы говору с богатой
синонимикой близость со всеми сразу — на любое сравнение нашёлся бы удобный
вариант (на этом чуть не попался Харбук, о нём ниже). Близость пары говоров —
среднее по всем их общим понятиям; всего пар — 946.
У метода есть честные ограничения, о которых стоит сказать сразу:
Метрика не отличает «другое слово» от «то же слово в другом
произношении». Мекегинское губен против литературного адиял «одеяло» —
лексическая замена; ургьу против урхьу «море» — фонетический сдвиг. В
матрице оба дают «расстояние». Это осознанно: мера отражает суммарную
непохожесть речи, как её слышит носитель.
Мы меряем словарь, а не язык. Что записано у Темирбулатовой — то и
сравнивается; полнота записи по говорам разная, а грамматика (склонение,
спряжение, синтаксис) в расчёт не входит вовсе.
Словарь вычитан носителями неравномерно. Полную проверку с исправлением
ошибок прошли пока лишь пять говоров — лучше всего вычитаны мекегинский и
урахинский. По остальным носители не раз указывали на неверные слова, но
взяться за систематическую вычитку — дело долгое — согласились немногие.
Наглядный пример цены вопроса — Дегва: её говор практически идентичен
мекегинскому, однако дегвинский материал не вычитан и известные ошибки в нём
пока не исправлены — так что даже самая тесная пара нашей матрицы,
Дегва—Мекеги (0.79), скорее всего занижена. Поправить конкретную статью
может любой носитель — в телеграм-боте
сайта у каждой статьи словаря есть кнопка
«Предложить изменения».
Это не генетическая классификация. Столетия соседства сближают словари
говоров даже разных ветвей — торговля, базары, смешанные браки. Дерево ниже
показывает, кто на кого похож сейчас, а не кто от кого произошёл.
Прежде чем читать результаты, метод стоит проверить на том, что известно и
без него. Проверка сходится: самой близкой парой из всех 946 оказались Акуша
и Леваши (0.82 — два говора акушинского диалекта), а ближе всех к
литературному языку — акушинский говор (0.84): литературный даргинский и
построен на акушинской основе. Значит, счётчику можно верить и там, где
готового ответа нет.
Матрица: все против всех
Вот главный результат одной картинкой — попарная близость всех 44 говоров.
Чем темнее клетка, тем ближе два говора; порядок строк подобран так, чтобы
похожие говоры стояли рядом, — поэтому вдоль диагонали проступают «кварталы»
диалектных групп. Цветные полосы вдоль осей показывают шесть языков, на
которые делит даргинские Р. О. Муталов в актуальной классификации
ИЯз РАН. Наведите курсор на клетку — увидите
точное значение.
Тёмные блоки читаются сразу: урахинско-акушинско-мекегинский «север» в левом
верхнем углу, плотный муиринско-харбукский квартал в середине, компактный
хайдакский блок ниже, отдельная пара Кубачи—Ашты. И наоборот: строки Мегеба,
Чирага, Амуха, Кубачи светлые почти по всей длине — это самые обособленные
идиомы даргинского мира. Самые далёкие друг от друга — Кубачи и Мегеб: 0.31,
меньше общего, чем у русского с болгарским.
Дерево: словарь воспроизводит классификацию
Ту же матрицу можно свернуть в дерево — алгоритм кластеризации (UPGMA) шаг за
шагом объединяет самые близкие говоры и группы. Серым подписана традиционная
диалектная атрибуция каждого говора — так, как она дана в словаре
Темирбулатовой и на страницах нашего словарного раздела, а
цветная метка — язык по шестичленной классификации Муталова (ицаринский и
амухский отнесены к цудахарско-сирхинскому предположительно, у самого
Муталова они со знаком вопроса).
Главное впечатление от дерева — насколько точно арифметика воспроизвела
классификацию, которую диалектологи строили десятилетиями. Алгоритм ничего
не знает ни о географии, ни об истории — только цепочки графем. И тем не
менее: семь урахинских говоров собрались в одну ветвь, пять хайдакских — в
другую, цудахарские, гапшиминские, кубачинские — каждый со своими. Первыми от
общего ствола отделились кубачинский, мегебский, чирагский, амухский,
ицаринский — ровно те идиомы, которые актуальная классификация Института
языкознания РАН считает отдельными языками,
а не диалектами.
Интересно и то, как дерево делит «север»: Акуша с Леваши и Мекеги с Дегвой и
Мюрего оказываются сёстрами внутри одной ветви, а Губден с Кадаром держатся
рядом отдельной парой — но по попарным числам их ближайшие соседи именно
мекегинская зона: у Губдена это Дегва, Мюрего и Мекеги (0.69–0.70), у
Кадара — Мюрего, Губден и Дегва. Это хорошо согласуется с гипотезой
Р. О. Муталова о мекегинско-мюрего-губденской
общности внутри севернодаргинского — и с тем, что показал наш диалектный
опрос.
Где данные спорят с классификацией
Пять говоров помечены на дереве кружком: их место по данным словаря не
совпадает с традиционной атрибуцией. Это самое интересное в таком расчёте —
машина не знает, «как принято», и потому честно показывает расхождения.
Дейбук. В словаре он значится говором мекегинского диалекта, но данные
категоричны: близость Дейбука к Мекеги — всего 0.56, а к Харбуку — 0.72 —
уровень, который в этой матрице показывают только говоры одного диалекта.
Дейбук и Харбук делят половину словаря дословно. То же показал и наш опрос: в анкетах
дейбукцы относили свою речь к муиринской зоне, а не к мекегинской. Два
независимых источника — словарь и живые носители — сходятся против бумажной
классификации.
Харбук. Этот говор сначала чуть не обманул нашу арифметику. Материал по
нему вдвое богаче, чем по любому другому: 4,5 тысячи фиксаций, в среднем
2,5 варианта на понятие против типичных 1,2–1,4. При простой метрике «лучшее совпадение
из всех вариантов» такое богатство делало Харбук ближайшим соседом чуть ли
не всех говоров разом — от Акуши до Ицари на каждое сравнение находился
подходящий синоним, чего в теории быть не может. Симметричная мера (см.
«Как считали») этот артефакт сняла, и осталась содержательная часть:
числясь говором мугинского диалекта, Харбук роднится с самим Муги лишь на
0.61, а его настоящие соседи — Дейбук (0.72), Меусиша и Кища (0.71),
Уркарах (0.70), то есть муиринский пояс.
Верхние Мулебки. Та же история: числятся мугинскими, но к Харбуку (0.69)
и муиринским говорам они ближе, чем к самому Муги (0.66). Мугинский диалект
в данных словаря вообще расползается: Муги уходит к акушинско-урахинскому
северу, а Харбук и Верхние Мулебки — к муиринскому центру. Раскол виден даже
по одной морфеме — глагольному инфинитиву: у Муги это северное -ес (90 %
глаголов), у Харбука и Верхних Мулебок — южное -ара (77 % и 68 %).
Герга. Записана муиринским говором, но в дереве сидит внутри урахинской
ветви: с Канасираги её близость 0.72, а с муиринской Меусишей — лишь 0.59.
Хуршни. Самый загадочный случай. Классификация относит его к сирхинскому
диалекту, но со «своей» Сирхой у него близость всего 0.53, а с Уркарахом —
0.71. Материала по Хуршни в словаре меньше, чем по другим говорам, так что
этот случай мы бы отдали на суд специалистов: либо говор действительно сильно
муиринизировался, либо в атрибуции материала есть путаница.
Сверка со Сводешем Корякова
Полезно поверить нашу линейку чужой. Ю. Б. Коряков в классификационной схеме
даргинских языков (2021) приводит проценты совпадений базовой лексики —
по классическому 100-словному списку Сводеша — между языками и наречиями.
Это другая методика с другой оптикой: список Сводеша смотрит только на самое
устойчивое ядро словаря («вода», «рука», «два», «спать»), которое почти не
заимствуется и потому хранит родословную; наша матрица перемалывает все
2 445 понятий подряд, включая быт, хозяйство и культурные заимствования. Мы
раскрыли каждый узел схемы Корякова в говоры Темирбулатовой, посчитали
среднюю близость между узлами — и получили 33 пары, у которых есть обе
оценки.
Корреляция двух шкал — 0.74 по Спирмену: два независимых метода на двух
разных срезах лексики раскладывают даргинские идиомы почти в одном порядке.
Для нашей матрицы это ещё одна внешняя проверка. Но самое интересное — точки,
выпадающие из тренда: расхождение линеек само по себе несёт информацию.
Юг по Сводешу монолитнее, чем по полному словарю. Чираг—Ицари по
базовой лексике 86.7 % совпадений — а по словарю целиком лишь 0.38, один из
самых низких показателей юга. Та же картина у пар Танты—Сирха (93 % против
0.55) и Кунки—Ицари (88.4 % против 0.48). Ядро у южных идиомов общее, а вся
остальная лексика успела разойтись — признак давнего дробления при общем
происхождении.
Контактные пары — ровно наоборот. Муиринский и кайтагский по Сводешу
далеки (75 % — это граница ветвей), но по полному словарю заметно теплее
своего ранга (0.50): столетия соседства и общие базары наполнили словари
общим материалом, не тронув ядра. Похоже ведут себя гапшиминский с
севернодаргинским и усиша-бутринским.
Мегеб. По Сводешу он на равных с северными соседями (83 % с
цудахарско-усишинским), по полному словарю — дальше всех (0.37). Село,
веками живущее в аварско-лакском окружении, сохранило даргинское ядро, но
бытовой словарь ушёл своей дорогой.
Короче: Сводеш меряет родословную, полный словарь — прожитую вместе или
врозь жизнь. Вместе две линейки говорят больше, чем каждая по отдельности.
Полная таблица сверки:
Пара узлов
Сводеш, %
Словарная близость
муиринский (внутри)
94
0.68
кайтагское (осн.) (внутри)
94
0.66
тантынское — сирхинское
93
0.55
севернодаргинский (внутри)
91
0.64
кайтагское (осн.) — санчинское
90.3
0.68
цудахарский — усиша-бутринский
89
0.57
аштынское — кубачинское
89
0.77
юго-западный даргинский (внутри)
89
0.49
кунки-амухское — санжи-ицаринский
88.4
0.48
цудахарско-усишинский блок — тантынское
88
0.61
севернодаргинский — цудахарско-усишинский блок
86.9
0.48
чирагский — санжи-ицаринский
86.7
0.38
гапшиминский — тантынское
86
0.55
севернодаргинский — муиринский
85.8
0.58
санжи-ицаринский — кайтагская группа
84
0.45
чирагский — кунки-амухское
84
0.44
гапшиминский — севернодаргинский
83.6
0.57
мегебский — севернодаргинский
83.4
0.45
мегебский — цудахарско-усишинский блок
83
0.37
гапшиминский — муиринский
83
0.51
цудахарский — муиринский
83
0.46
усиша-бутринский — муиринский
83
0.47
гапшиминский — усиша-бутринский
81
0.52
юго-западный даргинский — кубачинское
80.5
0.41
кубачинский — санжи-ицаринский
80.5
0.39
южная группа — кайтагская группа
78.9
0.42
чирагский — юго-западный даргинский
77.6
0.42
юго-западный даргинский — аштынское
77
0.41
муиринский — кубачинский
76.7
0.37
мегебский — гапшиминский
76
0.45
муиринский — кайтагский
75
0.50
чирагский — кайтагская группа
69
0.35
чирагский — северо-центральная группа
67
0.36
Мекегинский разрез
Теперь — вид с нашей колокольни. Вот десять ближайших соседей мекегинского
говора по словарю (в последней колонке — доля понятий, где формы совпадают
буква в букву):
Говор
Группа
Близость
Идентичных форм
Дегва
мекегинский
0.79
56 %
Мюрего
губденский
0.75
48 %
Акуша
акушинский
0.70
39 %
Мугри
урахинский
0.69
41 %
Губден
губденский
0.69
41 %
Мургук
урахинский
0.68
38 %
Леваши
акушинский
0.68
35 %
Бурдеки
урахинский
0.68
37 %
Канасираги
урахинский
0.66
33 %
Нижние Мулебки
урахинский
0.65
30 %
Дегва на первом месте ожидаемо — это говор того же мекегинского диалекта. А
вот второе место примечательно: Мюрего лексически ближе к Мекеги (0.75),
чем к Губдену (0.70), к диалекту которого его причисляет словарь. Треугольник
Мекеги—Мюрего—Губден в данных плотнее, чем «официальные» границы диалектов, —
ещё один аргумент в пользу давно замеченной мекегинско-мюрего-губденской
общности.
У этой общности есть и структурная примета. Там, где литературный язык (и
большинство говоров) в глаголах речи и состояния держит показатель -икIес,
зона Мекеги—Мюрего—Губден—Дегва системно даёт -укIес: гъайукIес
«говорить» (лит. гъайикIес), далайукIес «петь» (лит. далайикIес),
пикриукIес «думать», гьигьукIес «дышать», гьагьукIес «зевать»,
шакукIес «догадываться». В словаре эти формы не встречаются больше нигде —
изоглосса очерчивает зону аккуратно, как циркулем.
Есть и чисто лексические мекегинские особости — слова, которых словарь не
фиксирует ни в одном другом говоре: кьвази «веник» (лит. бушкала),
губен «одеяло» (лит. адиял), чIянкI «поле» (лит. авлахъ), гьарка
«юбка», мялгIун «чёрт» (лит. шайтIан), ругер «канава» (лит. татаул)
и даже дярдяраг «вентилятор». А общая для всей мекегинско-губденской зоны
замена цIабикь «очаг» (лит. анкъи) — красивый пример того, как зона
целиком выбрала другой корень: буквально «огневище».
И контрастный факт напоследок: Дейбук, «брат» Мекеги по классификации, в
этом списке отсутствует — он на двадцатом месте (0.56), ниже всей урахинской
группы и даже Хуршни.
Насколько говоры далеки от литературного
Литературное слово в словаре есть у каждого понятия — значит, тем же способом
можно измерить расстояние от каждого говора до письменного стандарта. Получилась
шкала того, сколько нового придётся выучить носителю каждого говора, садясь
за литературный даргинский:
Градиент очень крутой. Акушинец в литературном языке дома — 78 % слов
совпадают с его говором дословно. Мекегинец — в гостях у близкой родни: 0.68,
дословных совпадений уже лишь 36 %. А для кубачинца, чирагца или аштынца
(0.35–0.37) литературный даргинский — по словарному счёту дальше, чем
украинский от русского: не «выучить огрехи», а освоить почти другой язык.
Это стоит помнить в спорах о школьном преподавании «родного языка»: для
южной трети даргинского мира письменный стандарт роднее лишь номинально.
Звуковые паспорта говоров
Расстояния складываются из тысяч мелких замен, и замены эти не случайны —
выровняв каждую диалектную форму с литературной, компьютер выделил
систематические соответствия. По ним говоры узнаются, как по отпечатку:
Хорошо видно, что цудахарская, харбукско-муиринская и кубачинская зоны делят
общую южную черту — глухие геминаты на месте северных звонких (мацца,
ятта, уцци), — но расходятся окончаниями. А акушинская строка почти
пуста: это ещё раз показывает, чей говор лёг в основу стандарта.
Что у всех даргинцев одинаково
Матрица меряет различия, но словарь хранит и обратное — слова, единые от
Губдена до Чирага. Абсолютный чемпион — дарман «лекарство»: одна форма во
всех 44 говорах. Рядом — гьава «воздух», магьар «брачный акт», гIядат
«обычай», къалип «форма», шагьар «город», тупанг «ружьё», гами
«корабль», замана «время». Список красноречив: почти всё это культурные
заимствования — арабские, персидские, тюркские. Они пришли с исламом,
торговлей и книгой уже после расхождения диалектов и потому не успели
измениться. Исконная лексика в клубе «без изменений» тоже есть — цула
«зуб», хъяб «шея», дус «год», мура «сено», кари «печь», дукI
«ярмо», хIула «колесо», — но её меньше.
На другом полюсе — понятия-рекордсмены дробления. Глагол «делить пополам»
(лит. кIибайбирес) существует в словаре в 63 разных формах на 43
говора — почти у каждого своя. Немногим отстают «преследовать» (62 формы),
«лгать» (54) и, конечно, «бабочка» — 31 непохожее слово, от акушинского
къабулдан и мекегинского къабилдан до кайтагского пIирпIир,
цудахарского кьалима и кубачинского ляхIямцIала.
Вместо заключения
Сто лет диалектологи собирали этот материал ногами — от селения к селению,
тетрадь за тетрадью. Оцифровка добавила к их труду одно новое свойство:
теперь материал можно пересчитать целиком, без выборки и усталости, и
увидеть картину, которую не разглядеть с высоты одной экспедиции. Картина в
основном подтвердила классиков — но в пяти точках (Дейбук, Харбук, Верхние
Мулебки, Герга, Хуршни) задала вопросы, на которые стоит ответить уже не
компьютеру, а полевым лингвистам и самим носителям.
Все 44 говорных словаря, по которым сделан расчёт, открыты в словарном
разделе сайта — а если ваш родной говор записан у
Темирбулатовой неточно, в телеграм-боте сайта
у каждой статьи диалектологического словаря есть кнопка «Предложить
изменения». Живая
проверка носителями — то, чего этой матрице не хватает больше всего.
Техническая справка: расчёт выполнен по оцифрованной базе словаря
(40 933 записи, палочка нормализована к латинской I, знаки долготы сняты,
йотированные йа/йу/йо/йе сведены к я/ю/ё/е; сравнение — по графемам, где
диграфы, аффрикаты дз/дж, лабиализованные C+в и геминаты вида кк/тт/хIхI
считаются одним сегментом). Близость пары говоров — средняя по общим понятиям
симметричная мера лучших соответствий вариантов (устойчива к разной полноте
записи говоров); дерево — кластеризация UPGMA; средняя близость по всем
946 парам — 0.51. Сверка по Сводешу — проценты с классификационной схемы
даргинских языков Ю. Б. Корякова (2021).