- 1. Частотный анализ и базовые статистики текста
- 2. Меры лексического разнообразия
- 3. Ранговые распределения и закон Ципфа
- 4. N-граммы, коллокации и ассоциативные меры
- 5. Индексы читабельности
- 6. Стилометрия
- 7. Многомерная статистика и классификация
- 8. Информационно-теоретические меры
- 9. Синтаксические количественные метрики
- 10. Программные средства
Количественная лингвистика — раздел языкознания, применяющий статистические, математические и компьютерные методы для измерения свойств текста, проверки гипотез о языке и построения моделей языковых структур.
1. Частотный анализ и базовые статистики текста
Частотный анализ — исходный метод количественной обработки текста. Подсчитываются встречаемости единиц разных уровней: графем, морфем, словоформ, лемм, частей речи, синтаксических конструкций. Абсолютная частота n показывает число вхождений единицы; относительная частота вычисляется как f = n / N, где N — общее число единиц. Для сопоставления корпусов разного объёма применяют нормализацию ipm = (n / N) × 1 000 000.
- абсолютная и относительная частота;
- нормализованная частота ipm;
- ранговая и накопленная частота;
- дисперсия, стандартное отклонение, коэффициент вариации.
Частотный анализ позволяет выделять ключевые слова, строить частотные словари, сравнивать лексические профили текстов и оценивать покрытие словаря. Для выявления значимых различий частот применяются критерий хи-квадрат и логарифмическое правдоподобие.
2. Меры лексического разнообразия
Лексическое разнообразие отражает богатство словаря и степень повторов. Основная переменная — отношение числа уникальных лексем V к общему числу словоупотреблений N.
| Мера | Формула | Особенность |
|---|---|---|
| Type-Token Ratio (TTR) | V / N | Зависит от длины текста |
| Guiraud R | V / √N | Меньшая зависимость от N |
| Herdan C | log V / log N | Логарифмическая шкала |
| Maas A | (log N − log V) / log² N | Снижает влияние длины текста |
Меры лексического разнообразия применяются при оценке сложности текста, сравнении авторских стилей, анализе устной речи и речевого развития. Низкий TTR указывает на высокую повторяемость лексики, высокий — на широкий активный словарь.
3. Ранговые распределения и закон Ципфа
Частоты единиц упорядочиваются по убыванию, каждой присваивается ранг r. Распределение обычно подчиняется степенному закону Ципфа: f(r) ≈ C / r^a, где C — константа, a — показатель, близкий к 1. Лог-логарифмический график такого распределения близок к прямой с наклоном −a.
Проверка выполняется с помощью коэффициента детерминации и критериев согласия. Отклонения от закона Ципфа используются для обнаружения аномалий, выделения ключевых слов и сравнительного анализа корпусов. Обобщением является закон Ципфа — Мандельброта: f(r) = C / (r + b)^a.
4. N-граммы, коллокации и ассоциативные меры
N-граммы — непрерывные последовательности из n элементов: символьные, словные, морфологические или POS-граммы. Их частоты дают модель локальных сочетаний. Коллокации оцениваются мерами статистической ассоциации.
| Мера | Расчёт | Интерпретация |
|---|---|---|
| Mutual Information | log₂ (P(xy) / (P(x)P(y))) | Сила ассоциации, чувствительна к редким парам |
| t-score | (f_xy − f_x f_y / N) / √f_xy | Статистическая значимость |
| Log-likelihood ratio | 2 Σ O ln(O/E) | Устойчив к разреженным данным |
| Dice | 2f_xy / (f_x + f_y) | Нормализованная совместная встречаемость |
Словные и POS-триграммы применяются в распознавании авторства, определении жанра и машинном переводе.
5. Индексы читабельности
Читабельность оценивает сложность восприятия через длины слов и предложений. Наиболее известны индексы Флеша, Флеша — Кинкейда, FOG и SMOG.
| Индекс | Формула / параметры |
|---|---|
| Flesch Reading Ease | 206.835 − 1.015 ASL − 84.6 ASW |
| Flesch-Kincaid Grade Level | 0.39 ASL + 11.8 ASW − 15.59 |
| Gunning FOG | 0.4 (ASL + доля слов длиннее 3 слогов × 100) |
| SMOG | 1.0430 √(число многосложных слов × 30 / число предложений) + 3.1291 |
Для русского языка используют адаптированные версии: ASL — средняя длина предложения, ASW — среднее число слогов на слово. Индексы применяются в педагогике, издательском деле и при оценке сложности корпусов.
6. Стилометрия
Стилометрия — количественное описание авторского стиля. Наиболее информативны частоты служебных слов, длина слов и предложений, символьные n-граммы, POS-последовательности и лексические маркеры. Метод Delta Берроуза: частоты наиболее частых слов стандартизируются z-преобразованием, затем вычисляется евклидово расстояние между текстами.
- классификация и кластеризация текстов;
- верификация и атрибуция авторства;
- профилирование пола, возраста, родного языка;
- определение жанра и времени написания.
Стилометрия активно использует машинное обучение: метод опорных векторов, случайный лес, нейронные сети. Важна предобработка: лемматизация, удаление стоп-слов, отбор признаков по информативности.
7. Многомерная статистика и классификация
Для анализа таблиц «текст × признак» применяются методы снижения размерности и группировки. Главные компоненты (PCA) выделяют оси максимальной вариативности; анализ соответствий (CA) подходит для частотных матриц; многомерное шкалирование (MDS) визуализирует расстояния между текстами; t-SNE и UMAP используются для нелинейного снижения размерности.
Классификация выполняется с помощью дискриминантного анализа, наивного Байеса, логистической регрессии, SVM и ансамблей. Качество оценивается кросс-валидацией, точностью, полнотой и F-мерой.
8. Информационно-теоретические меры
Энтропия Шеннона измеряет неопределённость: H = −Σ pᵢ log₂ pᵢ, где pᵢ — вероятность единицы i. Условная энтропия показывает предсказуемость следующего элемента после известного контекста. Взаимная информация оценивает связь между лингвистическими переменными.
Энтропия применяется для оценки информационной плотности текста, сравнения жанров, анализа переводов и моделирования языковой сложности. Избыточность R = 1 − H / Hmax показывает долю предсказуемой информации.
9. Синтаксические количественные метрики
После синтаксического парсинга извлекаются структурные показатели: средняя длина предложения, средняя длина клаузы, глубина дерева зависимостей, количество подчинённых узлов, средняя длина синтаксической зависимости.
- Mean Dependency Distance (MDD) — среднее расстояние между управляющим и зависимым словом;
- Tree depth — глубина синтаксического дерева;
- Subordination ratio — доля подчинительных связей;
- Ratio of content to function words — соотношение знаменательных и служебных слов.
Эти метрики используются при изучении синтаксической сложности, переводческих универсалий, упрощении текста и диагностике речевых нарушений.
10. Программные средства
Для количественного анализа применяются: AntConc, WordSmith Tools, Voyant Tools, Sketch Engine; библиотеки Python NLTK, spaCy, Gensim, scikit-learn; пакеты R quanteda, tm, stylo; синтаксические парсеры UDPipe, Stanza, SyntaxNet. Выбор инструмента зависит от языка, размера корпуса и задачи.
