какие методы количественной лингвистики применяют к анализу текстов

Количественная лингвистика — раздел языкознания, применяющий статистические, математические и компьютерные методы для измерения свойств текста, проверки гипотез о языке и построения моделей языковых структур.

1. Частотный анализ и базовые статистики текста

Частотный анализ — исходный метод количественной обработки текста. Подсчитываются встречаемости единиц разных уровней: графем, морфем, словоформ, лемм, частей речи, синтаксических конструкций. Абсолютная частота n показывает число вхождений единицы; относительная частота вычисляется как f = n / N, где N — общее число единиц. Для сопоставления корпусов разного объёма применяют нормализацию ipm = (n / N) × 1 000 000.

  • абсолютная и относительная частота;
  • нормализованная частота ipm;
  • ранговая и накопленная частота;
  • дисперсия, стандартное отклонение, коэффициент вариации.

Частотный анализ позволяет выделять ключевые слова, строить частотные словари, сравнивать лексические профили текстов и оценивать покрытие словаря. Для выявления значимых различий частот применяются критерий хи-квадрат и логарифмическое правдоподобие.

2. Меры лексического разнообразия

Лексическое разнообразие отражает богатство словаря и степень повторов. Основная переменная — отношение числа уникальных лексем V к общему числу словоупотреблений N.

Мера Формула Особенность
Type-Token Ratio (TTR) V / N Зависит от длины текста
Guiraud R V / √N Меньшая зависимость от N
Herdan C log V / log N Логарифмическая шкала
Maas A (log N − log V) / log² N Снижает влияние длины текста

Меры лексического разнообразия применяются при оценке сложности текста, сравнении авторских стилей, анализе устной речи и речевого развития. Низкий TTR указывает на высокую повторяемость лексики, высокий — на широкий активный словарь.

3. Ранговые распределения и закон Ципфа

Частоты единиц упорядочиваются по убыванию, каждой присваивается ранг r. Распределение обычно подчиняется степенному закону Ципфа: f(r) ≈ C / r^a, где C — константа, a — показатель, близкий к 1. Лог-логарифмический график такого распределения близок к прямой с наклоном −a.

Проверка выполняется с помощью коэффициента детерминации и критериев согласия. Отклонения от закона Ципфа используются для обнаружения аномалий, выделения ключевых слов и сравнительного анализа корпусов. Обобщением является закон Ципфа — Мандельброта: f(r) = C / (r + b)^a.

4. N-граммы, коллокации и ассоциативные меры

N-граммы — непрерывные последовательности из n элементов: символьные, словные, морфологические или POS-граммы. Их частоты дают модель локальных сочетаний. Коллокации оцениваются мерами статистической ассоциации.

Мера Расчёт Интерпретация
Mutual Information log₂ (P(xy) / (P(x)P(y))) Сила ассоциации, чувствительна к редким парам
t-score (f_xy − f_x f_y / N) / √f_xy Статистическая значимость
Log-likelihood ratio 2 Σ O ln(O/E) Устойчив к разреженным данным
Dice 2f_xy / (f_x + f_y) Нормализованная совместная встречаемость

Словные и POS-триграммы применяются в распознавании авторства, определении жанра и машинном переводе.

5. Индексы читабельности

Читабельность оценивает сложность восприятия через длины слов и предложений. Наиболее известны индексы Флеша, Флеша — Кинкейда, FOG и SMOG.

Индекс Формула / параметры
Flesch Reading Ease 206.835 − 1.015 ASL − 84.6 ASW
Flesch-Kincaid Grade Level 0.39 ASL + 11.8 ASW − 15.59
Gunning FOG 0.4 (ASL + доля слов длиннее 3 слогов × 100)
SMOG 1.0430 √(число многосложных слов × 30 / число предложений) + 3.1291

Для русского языка используют адаптированные версии: ASL — средняя длина предложения, ASW — среднее число слогов на слово. Индексы применяются в педагогике, издательском деле и при оценке сложности корпусов.

6. Стилометрия

Стилометрия — количественное описание авторского стиля. Наиболее информативны частоты служебных слов, длина слов и предложений, символьные n-граммы, POS-последовательности и лексические маркеры. Метод Delta Берроуза: частоты наиболее частых слов стандартизируются z-преобразованием, затем вычисляется евклидово расстояние между текстами.

  • классификация и кластеризация текстов;
  • верификация и атрибуция авторства;
  • профилирование пола, возраста, родного языка;
  • определение жанра и времени написания.

Стилометрия активно использует машинное обучение: метод опорных векторов, случайный лес, нейронные сети. Важна предобработка: лемматизация, удаление стоп-слов, отбор признаков по информативности.

7. Многомерная статистика и классификация

Для анализа таблиц «текст × признак» применяются методы снижения размерности и группировки. Главные компоненты (PCA) выделяют оси максимальной вариативности; анализ соответствий (CA) подходит для частотных матриц; многомерное шкалирование (MDS) визуализирует расстояния между текстами; t-SNE и UMAP используются для нелинейного снижения размерности.

Классификация выполняется с помощью дискриминантного анализа, наивного Байеса, логистической регрессии, SVM и ансамблей. Качество оценивается кросс-валидацией, точностью, полнотой и F-мерой.

8. Информационно-теоретические меры

Энтропия Шеннона измеряет неопределённость: H = −Σ pᵢ log₂ pᵢ, где pᵢ — вероятность единицы i. Условная энтропия показывает предсказуемость следующего элемента после известного контекста. Взаимная информация оценивает связь между лингвистическими переменными.

Энтропия применяется для оценки информационной плотности текста, сравнения жанров, анализа переводов и моделирования языковой сложности. Избыточность R = 1 − H / Hmax показывает долю предсказуемой информации.

9. Синтаксические количественные метрики

После синтаксического парсинга извлекаются структурные показатели: средняя длина предложения, средняя длина клаузы, глубина дерева зависимостей, количество подчинённых узлов, средняя длина синтаксической зависимости.

  • Mean Dependency Distance (MDD) — среднее расстояние между управляющим и зависимым словом;
  • Tree depth — глубина синтаксического дерева;
  • Subordination ratio — доля подчинительных связей;
  • Ratio of content to function words — соотношение знаменательных и служебных слов.

Эти метрики используются при изучении синтаксической сложности, переводческих универсалий, упрощении текста и диагностике речевых нарушений.

10. Программные средства

Для количественного анализа применяются: AntConc, WordSmith Tools, Voyant Tools, Sketch Engine; библиотеки Python NLTK, spaCy, Gensim, scikit-learn; пакеты R quanteda, tm, stylo; синтаксические парсеры UDPipe, Stanza, SyntaxNet. Выбор инструмента зависит от языка, размера корпуса и задачи.

Красивые открытки
Татьяна Морозова
Редактор
Татьяна — наш главный эксперт по открыткам и теплым словам. 40 лет, художественное образование (Самара), 10 лет делает подборки открыток и пишет душевные поздравления для BipBap.ru
Добавить комментарий