Перейти к основному содержимому
Tooletto

Как счётчики слов на самом деле считают слова (и почему число различается в разных приложениях)

Вставьте один и тот же абзац в три разных счётчика слов — и можно получить три разных числа. Ни один из них не ошибается: они просто отвечают на слегка разные вопросы.

· 3 мин чтения

Один и тот же абзац, три разных числа

Вставьте одинаковый фрагмент текста в Microsoft Word, Google Docs и какой-нибудь третий инструмент подсчёта слов — и вполне реально получить три немного разных итога, причём не потому, что кто-то из них ошибся, а потому, что «слово» оказывается менее точным понятием, чем кажется на первый взгляд. Счётчику слов приходится принимать целый ряд небольших, конкретных решений о пограничных случаях, которые беглый взгляд на абзац попросту игнорирует: считать ли составное слово через дефис одним словом или двумя, разделяется ли сокращение на части, засчитывается ли отдельно стоящее число так же, как слово, состоящее из букв, и — для языков, вообще не использующих пробелы между словами, — что вообще отмечает границу слова. Разные инструменты принимают эти решения по-разному, и видимый итог — это просто сумма множества небольших, вполне обоснованных решений, а не единственный объективно правильный подсчёт.

Дефисы, сокращения и решения, незаметно сдвигающие итог

Составное слово через дефис вроде "well-known" можно разумно посчитать как одно слово или как два, и оба прочтения вполне обоснованы: оно функционирует как единая смысловая единица, но при этом явно образовано соединением двух отдельных слов. И Word, и Google Docs считают составное слово через дефис одним словом, поэтому следование этому соглашению — правильный вариант по умолчанию для всего, что должно соответствовать ожиданиям преподавателя или издателя по количеству слов, например для задания с заданным лимитом слов. Сокращения поднимают ровно тот же вопрос в другой форме — "don't" явно образовано слиянием двух слов, но функционирует как одно, — и те же основные текстовые редакторы снова считают его одним словом, а не двумя, и это опять же то соглашение, которого стоит придерживаться, если подсчёт должен совпасть с тем, что сообщил бы преподаватель, редактор или инструмент проверки лимита слов.

Отдельно стоящее число, одинокий знак препинания, окружённый пробелами, и другие странные токены поднимают уменьшенные версии того же вопроса, и разные инструменты решают их немного по-разному — и это настоящее, совсем не эффектное объяснение большинства мелких расхождений, которые люди замечают между одним счётчиком слов и другим. Ни одно из этих микрорешений само по себе сильно не меняет итог, но в паре сотен слов обычной прозы обычно достаточно дефисов, сокращений и странных токенов, чтобы расхождения сложились в заметную, хотя обычно небольшую, разницу в итоговом числе.

Почему разбиение по пробелам полностью не работает для некоторых языков

Счётчик слов, построенный на простом разбиении текста по пробелам, работает вполне сносно для английского и большинства европейских языков, потому что в этих языках слова традиционно разделяются пробелами. Но он полностью ломается для китайского, японского и тайского языков — ни один из них вообще не вставляет пробелы между словами: целый абзац китайского текста может оказаться сплошной, ничем не прерываемой последовательностью символов без единого пробела где бы то ни было, и счётчик, разбивающий текст по пробелам, засчитает этот абзац целиком ровно как одно «слово», сколько бы реальных слов он на самом деле ни содержал. Правильный подсчёт слов в этих языках требует настоящей лингвистической сегментации текста — анализа самих символов, чтобы вывести, где правдоподобно заканчивается одно слово и начинается следующее, с использованием той же логики сегментации, которую современные браузеры реализуют внутренне для выделения текста и переноса строк, — а не тривиального подхода с разбиением по пробелам, который отлично работает для языков с пробельным разделением и полностью разваливается для тех, где его нет.

Почему «правильное» соглашение — это всегда то, которым реально пользуется ваш читатель

Ни одно из конкурирующих соглашений для дефисов, сокращений или пограничных токенов не является объективно более правильным, чем другие, — это разные, в равной степени обоснованные ответы на по-настоящему неоднозначный вопрос. Что действительно важно на практике, так это с каким соглашением должен совпасть подсчёт: студенту, сдающему работу с заданным требованием по количеству слов, нужен инструмент, считающий так же, как считает его текстовый редактор, поскольку именно это почти наверняка и будет проверяться; автору, отправляющему текст в издание с собственным редакционным стандартом, нужно соответствовать тому соглашению, которое используют инструменты этого издания. Следование общему соглашению Word и Google Docs — составные слова через дефис и сокращения, каждое из которых считается одним словом, — это самый близкий аналог безопасного универсального варианта по умолчанию именно потому, что эти два инструмента вместе покрывают подавляющее большинство ситуаций, когда подсчёт слов должен совпасть с чем-то внешним и конкретным.

Похожие инструменты

Ещё в блоге