Анализ текста: статистика, читабельность, плотность
Анализ текста: частота слов, читабельность, плотность ключевых слов, SEO-анализ, оценка уникальности.
Посчитайте прямо здесь: Text → Statistics
Открыть инструмент целиком →Введение
Анализ текста — это не просто подсчёт слов. Полноценный анализ показывает структуру текста, его читабельность, плотность ключевых слов, частоту употребления, длину предложений и абзацев, оценивает SEO-потенциал. Такие метрики помогают копирайтерам и SEO-специалистам не вслепую писать статьи, а осознанно управлять структурой и содержанием. Один взгляд на статистику — и понятно, где текст перегружен длинными конструкциями, где не хватает ключевых слов, а где они, наоборот, повторяются слишком часто и есть риск попасть под фильтр за переспам.
В этой статье разберём, какие метрики анализа текста существуют, как их интерпретировать и какие выводы делать. Подсчёт базовых показателей доступен в онлайн-счётчике слов, а более глубокий анализ — через специализированные инструменты.
Зачем анализировать текст
Глазами оценить, насколько текст «хороший», невозможно — нужны объективные метрики. Анализ решает сразу несколько задач.
- SEO-оптимизация. Понимание плотности ключевых слов, длины мета-тегов, распределения терминов помогает ранжироваться выше и не попадать под фильтры за переспам.
- Читабельность. Длинные предложения и абзацы снижают понимание. Метрики читабельности показывают, где текст «тяжёлый» и требует переработки.
- Соответствие ТЗ. Технические задания на текст часто содержат требования по объёму, плотности ключей, количеству абзацев. Анализ проверяет соответствие.
- Стилистика. Частотный анализ выявляет тавтологию, повторяющиеся слова, любимые штампы автора.
- Оценка уникальности. Анализ n-грамм и фраз помогает выявить неуникальные фрагменты и перефразировать их.
- Сравнение вариантов. Сравнив метрики двух версий текста, можно понять, какая лучше подходит под задачу. Подробнее о сравнении — в материале про сравнение текстов.
Базовые метрики
Это количественные показатели, которые считает любой счётчик слов.
- Количество слов. Базовый объёмный показатель. Используется в ТЗ и для оценки времени чтения.
- Количество символов с пробелами и без. Стандарт для рекламных и редакционных расчётов.
- Количество предложений и абзацев. Структурные показатели. Мало абзацев при большом объёме — текст «кирпичом», тяжело читается.
- Средняя длина слова. В русском языке 6–8 символов — норма. Слишком длинные слова утяжеляют чтение.
- Средняя длина предложения. 10–15 слов — комфортно для чтения. Свыше 20 — предложение стоит разбить.
- Средняя длина абзаца. 3–5 предложений — оптимально. Длинные абзацы визуально отпугивают читателя.
- Время чтения. Оценка при скорости 180–200 слов в минуту. Помогает пользователям решить, читать ли статью.
Метрики читабельности
Читабельность — это объективная оценка того, насколько легко читать текст. Существует несколько формул, разработанных для английского языка и адаптированных для русского.
Индекс Флеша (Flesch Reading Ease)
Классическая формула, учитывающая среднюю длину предложения и среднее число слогов в слове. Результат — число от 0 до 100: чем выше, тем проще текст. Для английского 60–70 — стандартный уровень. Для русского формулу адаптируют с учётом морфологии.
Уровень образования (Flesch-Kincaid Grade)
Связанная метрика, показывающая, сколько лет образования нужно читателю, чтобы понять текст. 8-й класс — простой текст, 12-й — средний, выше 12 — сложный академический.
Туманность (Gunning Fog Index)
Учитывает долю «сложных» слов (три и более слогов) и среднюю длину предложения. Чем выше индекс, тем «туманнее» текст. Для массовой аудитории стремятся к 7–9, для академической — выше.
Индекс Колмогорова — адаптация для русского
Адаптация формул читабельности для русского языка, предложенная в отечественных исследованиях. Учитывает специфику кириллической морфологии и длину русских слов.
Метрики читабельности не идеальны: они не учитывают лексику, логику, контекст. Но как первичная оценка «тяжести» текста они полезны. Если индекс слишком низкий или высокий — повод пересмотреть структуру предложений.
Плотность ключевых слов
SEO-метрика, показывающая, какую долю текста занимает ключевое слово или фраза. Формула простая: количество вхождений ключа делится на общее число слов и умножается на 100%.
Оптимальная плотность — предмет дискуссий. Исторически рекомендовали 3–5%, но современные поисковики стали умнее и наказывают за переспам. Сейчас безопасный диапазон — 1–2% для основного ключа, до 1% для дополнительных. Важно не только число вхождений, но и их распределение: ключ должен встречаться в заголовках, в первом абзаце, равномерно по тексту.
Тошнота
«Тошнота» — русскоязычный SEO-термин, обозначающий повторение одного слова в тексте. Различают классическую и академическую тошноту. Классическая — корень квадратный из частоты самого частого слова (без стоп-слов). Академическая — отношение частоты самого частого слова к общему числу слов, в процентах. Норма классической тошноты — до 7–9, академической — до 7–8%. Превышение — признак переспама, текст могут расценить как SEO-спам.
Вода
«Вода» — доля стоп-слов и слов без смысловой нагрузки (местоимений, предлогов, союзов, вводных конструкций). Высокий процент воды — текст пустой, неинформативный. Норма — до 15–20%, выше — стоит пересмотреть лексику и убрать лишнее.
Частотный анализ
Частотный анализ показывает, какие слова и фразы встречаются в тексте чаще всего. Результаты выводятся таблицей или облаком слов. Полезные применения:
- Выявление тавтологии. Если одно слово встречается в каждом абзаце — это перебор, нужно заменить синонимами.
- Проверка ключей. Видно, какие ключевые слова и как часто употреблены, равномерно ли распределены.
- Анализ стиля. Любимые слова автора, штампы, повторяющиеся формулировки становятся очевидными.
- Поиск тем. В большом тексте топ слов показывает, о чём реально речь, в отличие от заявленной темы.
Частотный анализ обычно исключает стоп-слова — предлоги, союзы, местоимения, — иначе они всегда будут в топе и заслонят содержательные слова.
Анализ n-грамм
N-граммы — последовательности из N подряд идущих слов. Биграммы (N=2), триграммы (N=3) показывают часто встречающиеся словосочетания. Полезно для:
- поиска устоявшихся выражений и клише;
- анализа ключевых фраз длинного хвоста (long tail);
- выявления неуникальных фрагментов (если биграмма повторяется много раз, это подозрительно);
- проверки естественности языка — слишком одинаковые биграммы могут указывать на машинную генерацию.
SEO-анализ
Полноценный SEO-анализ текста объединяет несколько метрик.
- Объём. Достаточен ли объём для темы? Слишком короткий текст ранжируется хуже, слишком длинный — не дочитывают.
- Плотность основного ключа. В пределах 1–2%.
- Плотность LSI-слов. Тематические слова, расширяющие семантику, делают текст релевантнее.
- Тошнота и вода. В пределах нормы.
- Структура. Наличие H1, H2, H3, списков, изображений с alt.
- Длина мета-тегов. Title — до 60 символов, description — до 155–160.
- Уникальность. Доля неуникальных фрагментов через анализ n-грамм или внешние сервисы антиплагиата.
Подводные камни
- Метрики не равно качество. Текст с идеальной плотностью ключей и нормальной тошнотой может быть скучным и неинформативным. Метрики — инструмент, а не критерий истины.
- Адаптация формул. Формулы Флеша и Fog рассчитаны на английский. Прямое применение к русскому даёт искажения, нужны адаптации.
- Стоп-слова. Список стоп-слов в разных инструментах отличается, и плотность ключей может считаться по-разному. Важно понимать, какой список используется.
- Морфология. Подсчёт «слова» без учёта форм (дом, дома, дому — одно или три?) даёт разные результаты. Хорошие инструменты приводят слова к начальной форме (лемматизация).
- Сложные ключи. «купить ноутбук в москве» — это одно вхождение или каждое слово отдельно? Зависит от инструмента.
- HTML-разметка. Если анализировать текст с разметкой, метрики будут искажены. Нужно предварительно удалить теги.
Сценарии использования
Подготовка SEO-статьи
Написали черновик — прогнали через анализатор. Смотрите: объём 1200 слов (достаточно), плотность основного ключа 1.5% (норма), тошнота 6 (норма), вода 18% (на грани). Средняя длина предложения 14 слов (комфортно). Вывод: текст в целом годится, но стоит убрать немного воды и проверить LSI-слова.
Редактура тяжёлого текста
Автор принёс академический текст со средней длиной предложения 28 слов. Читатель утонет. Анализатор подсветил «тяжёлые» места — разбиваем длинные конструкции, упрощаем лексику. После правок средняя длина падает до 15, индекс читабельности растёт.
Проверка перед публикацией
Перед сдачей статьи клиенту проверяем: title 56 символов (укладывается в 60), description 152 (укладывается в 160), ключи распределены равномерно, тошнота в норме. Можно публиковать.
Аудит старых статей
На сайте 200 статей. Прогоняем через анализатор пакетно — находим переспамленные (тошнота > 10), водянистые (вода > 30%), слишком короткие. Эти статьи дорабатываем в первую очередь.
Лучшие практики
- Анализируйте черновик и финальную версию. На этапе черновика метрики помогают скорректировать структуру, на финале — убедиться, что всё в норме.
- Сравнивайте с конкурентами. Прогоните через анализатор топ-3 статей из выдачи по вашему запросу. Их метрики — ориентир для вашего текста.
- Не гонитесь за идеальными цифрами. Текст для людей важнее текста для метрик. Если цифры говорят одно, а здравый смысл — другое, доверяйте здравому смыслу.
- Учитывайте специфику ниши. Технические тексты естественно тяжелее развлекательных. Не пытайтесь сделать академическую статью лёгкой ценой потери точности.
- Используйте лемматизацию. Подсчёт с учётом форм слова даёт более корректные результаты, особенно для русского с его богатой морфологией.
Заключение
Анализ текста — объективная основа для редактурных и SEO-решений. Метрики объёма, читабельности, плотности ключей, тошноты и воды показывают сильные и слабые места текста, которые глазом не увидишь. Но метрики — инструмент, а не финальный суд: хороший текст для людей всегда важнее идеальных цифр. Используйте счётчик слов для базовой статистики и специализированные анализаторы для глубокого разбора — и ваши тексты станут и лучше читаемыми, и выше ранжируются.
Попробуйте эти инструменты
Похожие статьи
Счётчик слов: зачем нужен и как работает
Подсчёт слов, символов, предложений, абзацев. Использование для SEO, копирайтинга, академических текстов.
Конвертер регистра: UPPER, lower, Title, camelCase
Все типы изменения регистра текста: ВЕРХНИЙ, нижний, Заглавные, camelCase, snake_case, kebab-case.
Сравнение текстов: как найти отличия
Text diff инструменты, алгоритмы сравнения, использование в код-ревью, проверке плагиата.
URL slug генератор: SEO-оптимизация адресов
Что такое slug, как генерировать SEO-friendly URL, транслитерация, лучшие практики для ЧПУ.