- Самые длинные слова в русском языке
- Рекордные слова
- Длинные химические названия
- Бесконечные слова
- Длинные глаголы и другие части речи
- Длинные предлоги и наречия
- Самые длинные слова в русском языке
- Самые длинные слова в литературе
- Самые сложные слова
- Возможность понимания текста БЯМ при случайно перемешанных словах
- Развитие способностей языковых моделей
- Известность разбора слов с перемешанными буквами
- Исследование разбора перемешанных букв
- Результаты исследования
- Защита от заражения данных: ScrRec и ScrQA
- RealTime QA
- Scrambled Bench
- Пример задачи для ScrRec без примеров (zero-shot):
- Пример задачи для ScrQA:
- Включение примеров решений задачи
- Использование дополнительных датасетов
- Оценка производительности моделей в задачах решения алгебраических задач
- Пример задачи:
- Оценка производительности моделей
- Производительность в ScrRec
- Производительность в ScrQA
- Результаты
- Как я оптимизировал стандартную русскую раскладку
- История расположения букв на стандартной клавиатуре
- Как была разработана стандартная русская клавиатура
- Методика создания более оптимальной клавиатуры
- Выводы
- Клавиатуры для слепого десятипальцевого набора
- Оптимизация русскоязычной клавиатуры: история и примеры
- Клавиатура КРОИТВЕСНА
- Клавиатура болгарского государственного стандарта (БДС)
- История оптимизации клавиатуры
- Оптимизация расположения букв на клавиатуре
- Допущения
- Определение частотности используемых букв и биграмм
- Таблица 2. Частотность биграмм
- Определение массива времени нажатий всех клавиш и пар клавиш
- Примеры оптимального расположения букв
- Заключение
- Оптимизация расположения клавиш на русской клавиатуре
- Среднее время набора текста с оптимизированной клавиатурой значительно сокращается
- Преимущества оптимизированной клавиатуры
Самые длинные слова в русском языке
Русский язык известен своими длинными словами. Несмотря на то, что русский язык считается достаточно сложным, у него есть свои интересные особенности. Рассмотрим некоторые из самых длинных слов в русском языке.
Рекордные слова
Если говорить о самых длинных словах, то в Книге рекордов Гиннеса самым длинным словом русского языка объявлено слово рентгеноэлектрокардиографического, состоящее из 33 букв. Это был рекорд в 1933 году. Однако, в 2003 году это слово было обновлено словом из 35 символов – превысокомногорассмотрительствующий.
Длинные химические названия
Химия также известна своими длинными словами. Например, прилагательное тетрагидропиранилциклопентилтетрагидропиридопиридиновые состоит из 55 букв. Еще одно длинное слово из химии — метоксихлордиэтиламинометилбутиламиноакридин, состоящее из 44 букв.
Бесконечные слова
Русский язык также позволяет создавать бесконечные конструкции. Например, приставка пра- может использоваться в понятии, обозначающем степень родства, множество раз – прапрапрапрапрапрапрапрапрапрапрадедушка. Однако, данные слова не являются повсеместно употребляемыми.
Длинные глаголы и другие части речи
Самые длинные глаголы в русском языке – переосвидетельствоваться и интернационализироваться, состоящие из 24 букв. Если добавить окончание, такое как -ующимися, то получится по 25 букв. В наиболее длинных существительных – человеконенавистничество и высокопревосходительство – также по 24 буквы. Словаформы множественного числа этих слов могут состоять из 26 букв (хотя первое слово во множественном числе не употребляется). Самые длинные одушевленные существительные содержат по 21 букве – это слова одиннадцатиклассница и делопроизводительница. Самое длинное междометие, зафиксированное в русских словарях – физкульт-привет.
Длинные предлоги и наречия
Предлоги и союзы обычно считаются короткими словами, но есть исключения. Например, слово соответственно состоит из 14 букв. Среди наречий, есть только одно длинное наречие – неудовлетворительно, состоящее из 19 букв.
Русский язык может быть сложным и содержать длинные слова, но в то же время он полон интересных особенностей и возможностей. Открытие и изучение этих особенностей поможет говорить и писать на русском языке более эффективно и красочно.
Самые длинные слова в русском языке
Некоторые спорят, можно ли рассматривать как самые длинные слова в русском языке существительные и прилагательные с дефисами, ведь склеены они искусственно, но все же обратим внимание и на них.
- Сельскохозяйственно-машиностроительный – 38 знаков
- Корчеватель-бульдозер-погрузчик – 31 знак
Похожие слова без дефисов:
- Электрофотополупроводниковый – 28 знаков
- Водогрязеторфопарафинолечение – 29 знаков
Наиболее длинное пищевое словообразование – из 38 знаков – Хлебосколбаскойлюбезнопроизводительный. Это слово отмечено в авторитетном источнике – орфографическом словаре Российской академии наук (отв. ред. В. В. Лопатин).
Самые длинные слова в литературе
Если вспомнить классическую литературу, то у Николая Лескова встречается в одном из его популярных рассказов слово попреблагорассмотрительствующемуся. Интересно, что никто не может достоверно объяснить, что оно означает – скорее всего, Лесков сам его придумал.
Наверное, произведет на вас неизгладимое впечатление и самая длинная аббревиатура: HИИОМТПЛАБОПАРМБЕТЖЕЛБЕТРАБСБОРМОHИHОТДТЕХСТРОМОHТ. Не будем перечислять полностью название этого института – оно займет целый абзац. Представьте, как сотрудникам этого научного заведения сложно было называть при необходимости свою должность или место работы.
Занимательный факт – есть чрезвычайно длинное слово, обозначающее фобию – боязнь как раз длинных слов! Звучит оно так: гиппопотомомонстросесквиппедалиофобия (37 знаков). Кстати, это вообще-то латинский термин hippopotomomonstrosesquippedaliophobia, который признан самым длинным словом в мире.
Самые сложные слова
Немало интересных фактов можно найти и касательно самых сложных слов русского языка. Например, принято считать, что три е есть только в слове длинношеее. Между тем, есть еще и змееед. Можно найти в словарях и слова, начинающиеся на Ы – Ытык-кюёль, Ыгыатта, Ыныкчанский и так далее. Все они сложно выговариваются из-за непривычных для нас сочетаний букв.
Но в русском языке есть и другие сложно произносимые слова. Особенно они доставляют неудобства дикторам или лекторам, работа которых – как раз произносить вслух тексты. В частности, к таким словам можно отнести:
- Воспользовавшемуся
- Предшествовавшими
- Участвовавшими
- Облагодетельствованные
- Нововодолашского
Не назовешь простыми и слова:
- Эвфемизм
- Пфальцграфство
- Предпразднство
Вот такой он – богатый на длинные слова русский язык.

Возможность понимания текста БЯМ при случайно перемешанных словах
В научной работе Unnatural Error Correction: GPT-4 Can Almost Perfectly Handle Unnatural Scrambled Text (arXiv:2311.18805), авторы исследования представляют наблюдения о возможности языковой модели GPT-4 понимать текст, где все буквы в каждом слове случайно переставлены. Это противоречит интуитивному предположению о том, что такие неестественные изменения в словах могут помешать пониманию текста моделью.
Развитие способностей языковых моделей
Развитие способностей языковых моделей происходит постепенно. В начале небольшие модели могут случайным образом выполнять задачи только с низкой производительностью. Однако при увеличении размера модели происходит резкий фазовый переход, в результате которого модель начинает демонстрировать новую эмерджентную способность, которую нельзя предсказать на основе анализа небольших систем.
Известность разбора слов с перемешанными буквами
Умение разбирать слова с перемешанными буквами описано еще давно. В научной статье Emergent Abilities of Large Language Models (arXiv:2206.07682), опубликованной в 2022 году, упоминается, что разбор слов с перемешанными буквами используется как один из бенчмарков при исследовании эмерджентных способностей языковых моделей.
Исследование разбора перемешанных букв
В прошлом исследования проводились на уровне перемещения слов (arXiv:2104.06644, arXiv:2203.10995), и было установлено, что понимание естественного языка почти не зависит от случайного порядка слов в моделях, как на стадии обучения, так и на стадии тестирования.
Однако исследователи заметили, что перемещение букв внутри слов может оказывать большое влияние на понимание текста моделями. Языковые модели не оперируют словами человеческого языка напрямую, а используют токенизацию, разделяя промпт на токены и присваивая каждому токену целое число.
Результаты исследования
Авторы работы Unnatural Error Correction: GPT-4 Can Almost Perfectly Handle Unnatural Scrambled Text провели исследование, в котором показали, что современные флагманские языковые модели, такие как GPT-4, без проблем справляются с текстом, где все буквы в словах случайно переставлены. Для проверки этих наблюдений был разработан бенчмарк Scrambled Bench, состоящий из двух типов задач:
- Задание на расшифровку слова, где все буквы переставлены в случайном порядке.
- Оценка понимания текста при наличии ошибок в случайно перемешанных словах.
Работа исследователей показала, что современные языковые модели успешно справляются с такими неестественными изменениями в тексте.

В целом, исследование демонстрирует, что языковые модели способны эффективно обрабатывать текст с перемешанными буквами и понимать его без проблем. Это открывает новые перспективы для использования подобных моделей в различных задачах, связанных с обработкой текста и коррекцией ошибок.
Защита от заражения данных: ScrRec и ScrQA
Заражение данных — серьезная проблема. Речь идет о том, что наборы тестовой информации публикуются в открытом доступе в Интернете, что может привести к их попаданию в датасеты для обучения Большим языковым моделям (БЯМ).
RealTime QA
Чтобы избежать заражения, исследователи использовали набор вопросов из бенчмарка RealTime QA. Этот бенчмарк регулярно обновляется и содержит вопросы о недавних новостных событиях. Вероятность того, что эти события могут быстро попасть в память БЯМ, крайне мала.
Scrambled Bench
Для создания Scrambled Bench было отобрано 419 примеров из периода с 17 марта по 4 апреля 2023 года. При этом исследователи не объясняют причину выбора более ранних материалов. Затем были составлены предложения с дополнительной информацией из Википедии. В результате получилось 418 задач для ScrRec и 346 задач для ScrQA.
Пример задачи для ScrRec без примеров (zero-shot):
БЫМ: Разработчик Ruby был обфусцирован до такой степени, чтобы скрыть свой настоящий исходный код, согласно ADF. Манипуляции с аргументом представлены в чеке на продукты, чтобы они имели домашний и понятный вид.
В данной задаче БЫМу предлагается восстановить изначальное предложение.
Пример задачи для ScrQA:
Какой тип продукта недавно был распределен в некоторые магазины США, несмотря на предупреждение о отзыве?
(A) Приправа для салата
БЫМ должна выбрать правильный вариант ответа, в данном случае — B, детская питательная смесь.
Включение примеров решений задачи
Помимо обычных задач, для ScrRec также были предоставлены примеры решений задачи (few-shot), используя текст из датасета wikiQA.
Использование дополнительных датасетов
В рамках ScrQA были использованы датасеты DREAM (doi:10.1162/tacl_a_00264) и AQuA-RAT (doi:10.18653/v1/P17-1015).
Из датасета DREAM было выбрано 1025 примеров. Ниже приведен пример задачи, в которой требуется ответить с использованием дополнительных инструкций из DREAM:
Я: Какой язык вы только что использовали в этом сообщении?
О: Он был смешанный. Чтобы быть честным, я редко использую этот метод, поскольку я не очень уверен в своих способностях. Я пытаюсь преодолеть страх перед ним.
Далее в задаче предлагается выбрать правильный вариант ответа из предложенных.
Примечание: При этом в задачах ScrQA требуется только правильный вариант ответа.
В результате исследований ScrRec и ScrQA были получены наборы задач, разработанных для обучения Большим языковым моделям с целью защиты от заражения данных. Эти задачи представляют собой важный шаг в обеспечении безопасности обучения БЯМ.
Оценка производительности моделей в задачах решения алгебраических задач
Для решения алгебраических задач из сборника AQuA-RAT использовался подход с примерами решения похожих задач (few-shot) в формате цепочки рассуждений (chain of thought). В промпте представлены условия задач с переставленными буквами, а варианты ответа, решение и фактический ответ остаются в том же виде. В конце промпта представляется еще одна задача без решения.
Пример задачи:
Ответ: Общая продолжительность поездки — 36.36 миль.
Варианты ответа:
- (A)10
- (B)11.5
- (C)12.5
- (D)13.5
- (E)15
В задаче условие представляется как перестановка текста:
Поезд, движущийся со скоростью 100 миль в час, затрачивает 10 часов, чтобы достичь пункта назначения. После преодоления четверти расстояния он начинает набирать скорость, и его приходится замедлить до 75 миль в час. Каково общее время путешествия?
Буквы в условии перемешивали тремя способами. При этом порядок цифр в числах оставался неизменным.
Оценка производительности моделей
Для оценки производительности использовались как современные открытые модели (семейства Llama-2, Falcon, UL2 и T5), так и проприетарные решения (text-davinci-003, GPT-3.5-Turbo и GPT-4).
Производительность в ScrRec
Для расчета производительности в ScrRec использовалось среднее расстояние Левенштейна ED (editing distance) между оригинальным предложением (ori) и восстановленным предложением (scr). Расстояние преобразуется в метрику Recovery Rate (RR) для разных образцов i по следующей формуле:
RR = (ED(ori, scr) — ED(scr, i)) / ED(ori, i)
Производительность в ScrQA
При оценке правильности ответа в ScrQA учитываются различия в способностях моделей относительно самих вопросов. Для моделей вычисляется показатель относительной производительности (RPG, Relative Performance Gain), который зависит от точности при оригинальном тексте (ori), перемешанном тексте (scr) и случайно замененном тексте (sub).
Результаты
Результаты показывают значительное превосходство модели GPT-4 в восстановлении текста даже при полной перестановке всех букв в словах. Показатель Recovery Rate (RR) для GPT-4 не падает ниже 95%.
Модель GPT-4 также показывает отличные результаты в текстовых задачах ScrQA на основе новостных текстов из RealTime QA. Даже при полном перемешивании всех букв в словах, она сохраняет 87,8% производительности.
График ниже демонстрирует влияние уровня перемешивания на производительность моделей в задачах из датасета RealTime QA:

Также проведена проверка восприятия текста на датасете DREAM, которая только подтвердила превосходство модели GPT-4 перед другими моделями. Увеличение требований к пониманию текстов сказалось на производительности моделей, и в некоторых типах задач открытые модели не справляются.

На графике выше продемонстрирована производительность моделей в задачах из датасета DREAM на различных категориях вопросов при максимальной интенсивности перемешивания.
Исследование показало, что модель GPT-4 показывает высокую производительность в задачах решения алгебраических задач с перемешанными буквами.
Как я оптимизировал стандартную русскую раскладку
При интенсивном наборе текстов на клавиатуре часто возникает ощущение неоптимальности движения пальцев, что наталкивает на мысль о существовании более удобного расположения букв на клавишах.
История расположения букв на стандартной клавиатуре
На самых первых экспериментальных пишущих машинах, изобретённых в США Лэтемом Шоулзом, буквы на клавишах располагались в алфавитном порядке, по аналогии с телеграфными аппаратами тех лет.
Такое расположение клавиш делало машину довольно громоздкой, поэтому, впоследствии, Шоулз разместил алфавитные клавиши в 4 рядах, попутно оптимизировав расположение букв с учётом механизма машины и частоты набора клавиш.
Шоулз не переставал экспериментировать с расположением букв. Порядок QWERTY является результатом его экспериментов по состоянию на 1875 год, когда его машина начала массово выпускаться. Расположение клавиш в его последнем патенте было совершенно иное.
В золотой век пишущих машин, в 1880-е стали появляться машины с альтернативными алфавитными клавиатурами: Каллиграф (1880), Крэндель (1883), Гаммонд Идеал (1885), где наиболее частые буквы располагали под указательными пальцами.
Как была разработана стандартная русская клавиатура
Стандартная русская раскладка клавиатуры основана на принципах эргономики и оптимизации скоростного набора текста. Она была разработана с учетом частоты использования букв и удобства набора с учетом позиций пальцев на клавиатуре.
Методика создания более оптимальной клавиатуры
Для создания более оптимальной клавиатуры, следует учесть следующие принципы:
- Частота использования букв. Более часто используемые буквы должны быть размещены под более сильными пальцами для быстрого и удобного набора.
- Расстояние между буквами. Буквы, часто используемые вместе, должны находиться возле друг друга, чтобы уменьшить время перемещения пальцев.
- Эргономический дизайн. Клавиатура должна быть комфортной для использования в течение длительного времени, учитывая естественное положение рук и пальцев.
- Проверка и тестирование. После разработки новой клавиатуры, необходимо провести тестирование и получить обратную связь от пользователей для ее оптимизации и улучшения.
Выводы
Оптимизация стандартной русской раскладки клавиатуры может значительно повысить эффективность и удобство набора текста. При разработке новых раскладок следует учитывать принципы эргономики и тщательно тестировать их на пользователях. Более удобная клавиатура поможет ускорить работу и снизить нагрузку на руки и пальцы пользователей.
Клавиатуры для слепого десятипальцевого набора
С появлением клавиш с легким ходом, опытные пользователи стали использовать все пальцы при наборе текста. В 1888 году стенографист Франк Макгуррин разработал метод слепого десятипальцевого набора: все алфавитные клавиши на клавиатуре были закреплены за восьмью пальцами, которые постоянно располагались в основной позиции. Это позволило снизить когнитивную нагрузку (не требовалось время на визуальный поиск нужной клавиши) и повысить физическую совместимость (уменьшилось время на перемещение пальцев по клавиатуре).
Появление метода десятипальцевого набора должно было привести к созданию адаптированных под него клавиатур. Однако, в 1888 году на съезде производителей пишущих машин было принято решение о стандартизации всех новых пишущих машин под клавиатуру QWERTY, так как она была наиболее распространенной. Тем не менее, в 1893 году была выпущена машина Бликенсдерфер с десятипальцевой клавиатурой. Наиболее часто используемые буквы английского алфавита d h i a t e n s o r были размещены на основном ряду клавиш, а не в центральной части клавиатуры.
В итоге, важно отметить, что существовали два разных подхода к повышению эргономики клавиатур:
Для набора кириллицы использовались:
2 4 5 6 7 8 9 % ц э й i у к е н г ш щ з х ф ы в ъ а п р о л д ж я ч ѣ с м и т ь б ю

Русская клавиатура была разработана с учетом недостатков клавиатуры QWERTY. Буквы, которые чаще всего используются, были помещены в середину клавиатуры, под указательные и средние пальцы рук. При создании русской клавиатуры, разработчики Ремингтона расположили буквы в алфавитном порядке (отчетливая видна последовательность букв йiшщпрджячеъсмитьбю) и переставили их в соответствии с принципами расположения букв в русской типографской кассе (частые буквы ближе к центру).
Для уменьшения когнитивной нагрузки, буквы, образующие наиболее частые биграммы (последовательность из двух букв, которые набираются подряд), были расположены рядом друг с другом. Например, буквы е и н образуют биграммы ен и не, которые являются одними из самых часто встречающихся в русском языке. То есть, после буквы е чаще всего следует буква н. Близкое расположение этих букв на клавиатуре позволяет сократить время на поиск и быстрее перемещать палец на следующую клавишу. Такие последовательные нажатия смежных клавиш называются перекатами.
Оптимизация русскоязычной клавиатуры: история и примеры
Буква ъ образовывала вокруг себя целую область частых биграмм с буквами к, в и с, так как в дореволюционной орфографии, после всех слов, оканчивающихся на эти буквы, ставился твёрдый знак. Такой подход упрощал процесс набора для неопытных пользователей клавиатур. Однако, он приводит к тому, что многие частые биграммы, например, то, приходится набирать одним пальцем, что снижает чередуемость пальцев при наборе.
После революции из русского языка были исключены буквы i, ъ и ѣ. Производители пишущих машин сдвинули остальные буквы на место исключённых, что привело к трудностям у пользователей, привыкших к стандартной дореволюционной клавиатуре. Чтобы решить эту проблему, на место букв i, ъ и ѣ были помещены редкие буквы ц, э и знак /. Впоследствии букву э и знак / вернули на периферию.
Клавиатура КРОИТВЕСНА
Машина Бликенсдерфер, предназначенная для 10-пальцевого слепого набора, поставлялась в Россию со следующей клавиатурой:
| 1 | 2 | 3 | 4 | 5 | , | . | |
|---|---|---|---|---|---|---|---|
| й | ц | у | к | е | н | г |
| 6 | 7 | 8 | 9 | 0 | ё | |
|---|---|---|---|---|---|---|
| ш | щ | з | х | \ | / |
Редкие буквы э, ф, х, ъ, ь и ы находились в дополнительном регистре.
Буквы были расположены так, что более 65% нажатий приходилось на первый — основной ряд, наиболее удобный для набора на этой машине. Здесь также использовался принцип близкого расположения букв частых биграмм (очень высокая доля нажатий с перекатами).
Клавиатура болгарского государственного стандарта (БДС)
В конце ХIХ века в Болгарии долго не могли определиться с тем, какая из предложенных американцами машин имеет лучшую клавиатуру, так что в 1907 году начальник стенографического бюро Народного собрания Болгарии Теодор Гы́лыбов провёл исследования частотности букв в болгарском языке, проанализировав их употребление в 10 000 слов. По результатам этого исследования была разработана болгарская клавиатура для десятипальцевого набора:
| 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 0 | |
|---|---|---|---|---|---|---|---|---|---|---|
| ы | у | е | и | ш | щ | к | с | д | з |
| ц | я | а | о | ж | г | ь |
Болгарская клавиатура пишущей машины Адлер 7
Наиболее часто используемые буквы о, н, т и а расположены так, чтобы их можно было набирать более сильными пальцами — указательным и средним. Для того, чтобы обе руки чередовались как можно чаще, гласные и полугласные располагаются на левой стороне клавиатуры, а большинство согласных — на правой. Клавиатура Гы́лыбова стала стандартом в Болгарии (БДС). С нею болгары регулярно выигрывали международные соревнования по машинописи, печатая со скоростью более 1000 знаков в минуту.
Только спустя 30 лет, в 1930-е годы, Август Дворак, американский профессор педагогики, предпринял попытку популяризировать идею повышения скорости печати за счёт перестановки букв на клавиатуре QWERTY, используя принципы клавиатуры Бликенсдерфера образца 1893 года. Но также, как и полувеком ранее, идея частотной оптимизации клавиатуры не обрела популярности у приученных к QWERTY пользователей.
История оптимизации клавиатуры
История показывает, что идея оптимизации клавиатуры, какой бы прирост в производительности она не давала, не может обрести популярности у приученных к стандартной клавиатуре пользователей без вмешательства государства.
Тем не менее, есть пользователи одержимые повышением производительности, готовые переступать через свои привычки и пренебрегать стандартами. С ними я хочу поделиться своим опытом оптимизации русской клавиатуры.
Оптимизация расположения букв на клавиатуре
Целью предлагаемой мной оптимизации расположения букв является сокращение времени набора текста на клавиатуре. В отличие от большинства существующих методик, использующих для оценки оптимизации такие показатели как баллы, штрафы, сложности, трудозатраты и другие сложноизмеримые показатели, в рассматриваемой методике оптимизации используется только одна точная метрика — время.
Объектом оптимизации является не стандартная матрица клавиш с архаичным горизонтальным сдвигом рядов, а более перспективная и используемая в большинстве современных эргономичных клавиатур ортолинейная матрица размером 3х11 клавиш.
Сдвинутое (классическое) расположение клавиш на клавиатуре ЙЦУКЕН:
й ц у к е н г ш щ з х ъ ф ы в а п р о л д ж э я ч с м и т ь б ю ё
Ортолинейное расположение клавиш клавиатуры ЙЦУКЕН (матрица):
| 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | й | ц | у | к | е | н | г | ш | щ | з | х |
| 2 | ъ | ф | ы | в | а | п | р | о | л | д | ж |
| 3 | э | я | ч | с | м | и | т | ь | б | ю | ё |
Допущения
Общий принцип оптимизации заключается в минимизации суммы произведений значений частотности употребляемых биграмм и значений времени нажатий соответствующих им клавиш:
n — количество биграмм и соответствующих им пар клавиш;
Fi — значение частоты встречаемости биграммы i;
ti — время последовательного нажатия двух клавиш соответствующих биграмме i.
Определение частотности используемых букв и биграмм
Оптимизируя клавиатуру для личного использования, необходимо полагаться на личный корпус часто‑набираемых текстов, а не на абстрактную статистику частотности или нерепрезентативный корпус текстов. Для этого проще всего собрать все набранные ранее тексты и тексты с близкой тематикой (например любимая литература или статьи). Тексты записываются в несколько файлов — частей корпуса, например:
- Книги
- Статьи
- Аудиозаписи
Для каждой части корпуса подсчитывается количество всех букв алфавита и определяется их частота (как отношение встречаемости определённой буквы к количеству всех букв).
Таблица 1. Частотность букв:
| Буква | Частота |
|---|---|
| а | 0.12 |
| б | 0.05 |
| в | 0.08 |
| г | 0.03 |
| д | 0.06 |
| е | 0.09 |
| ё | 0.01 |
| ж | 0.04 |
| з | 0.03 |
| и | 0.07 |
| й | 0.02 |
| к | 0.05 |
| л | 0.05 |
| м | 0.04 |
| н | 0.07 |
| о | 0.11 |
| п | 0.04 |
| р | 0.06 |
| с | 0.07 |
| т | 0.06 |
| у | 0.04 |
| ф | 0.02 |
| х | 0.02 |
| ц | 0.03 |
| ч | 0.03 |
| ш | 0.02 |
| щ | 0.02 |
| ъ | 0.01 |
| ы | 0.02 |
| ь | 0.04 |
| э | 0.02 |
| ю | 0.02 |
| я | 0.04 |
| пробел | 0.05 |
Ранжировка букв по частоте отличается для разных частей корпуса. Поэтому итоговое значение частоты определяется как среднее значение частот частей корпуса, либо как произведение частот на коэффициенты приоритетности той или иной части корпуса.
Сопоставив полученные значения частотности букв с матрицей ЙЦУКЕН, получается следующая диаграмма:
Частотность букв клавиатуры ЙЦУКЕН. Размер круга соответствует частоте буквы. Оранжевыми кругами обозначены гласные буквы, синими — согласные.
Аналогично формируется таблица частотности биграмм, при этом пробелы и знаки пунктуации заменяются на символ _. Итого 34^2 биграмм.
Таблица 2. Частотность биграмм
Подсчитать буквы и биграммы в текстах можно с помощью простой программы на Питоне:
Определение массива времени нажатий всех клавиш и пар клавиш
Время набора букв на клавиатуре состоит из 3 отрезков:
Время на поиск нужной клавиши — когнитивная составляющая процесса набора, зависящая от опытности. При освоении метода слепого набора, время на поиск нужной клавиши равно нулю.
Время на перемещения пальцев — физическая составляющая процесса набора. Сократить время на перемещение пальцев можно, расположив клавиши наиболее частых букв в основной позиции. Время на перемещение пальцев зависит от удалённости клавиш от основной позиции.
Простой пример оптимизации времени перемещения: Если время на перемещение пальца на одну клавишу составляет 50 миллисекунд, то матрица потерянного при нажатиях времени будет выглядеть следующим образом:
| Й | Ц | У | К | Е | Н | Г | Ш | Щ | З | Х | |||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Й | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 | 50 | 70 | 0 | 0 |
| Ц | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 | 50 | 70 | 0 |
| У | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 | 50 | 70 |
| К | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 | 50 |
| Е | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 |
| Н | 50 | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 | 50 |
| Г | 50 | 50 | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 | 50 |
| Ш | 70 | 50 | 50 | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 | 70 |
| Щ | 70 | 70 | 50 | 50 | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 | 70 |
| З | 50 | 70 | 70 | 50 | 50 | 50 | 70 | 0 | 0 | 50 | 50 | 50 | 50 |
| Х | 50 | 50 | 50 | 70 | 70 | 50 | 50 | 50 | 70 | 0 | 0 | 50 | 50 |
Перемножая значения частотности букв из таблицы 1 в соответствии с матрицей ЙЦУКЕН на матрицу потерянного при перемещениях пальцев времени, получаем среднее значение потерянного при перемещениях времени — 38,8 мс.
Теперь, переставляем буквы в матрице, так чтобы самые частые буквы были в основном ряду, например, таким образом:
| | М | К | Д | П | Ё | Э | У | Я | Ь | Ы | Ф | Р | Т | И | О | Л | В | С | Е | А | Н | Й | Ч | З | Г | Б | Ц | Щ | Ж | Ш | Х | Ю | Ъ |
|—|—|—|—|—|—|—|—|—|—|—|—|—|—|—|—|—|—|—
Существует несколько способов разделить клавиатуру на две половины. Один из них — это расположение букв по частоте использования при наборе текста. Буквы, которые часто используются вместе, должны находиться на разных руках и пальцах.
Другой способ — это расположение букв в соответствии с анатомией руки. Клавиши должны быть размещены таким образом, чтобы пальцы использовались в максимально комфортном положении.
Также существуют клавиатуры с разными раскладками, которые учитывают конкретные потребности пользователей. Например, для программистов разработаны специальные раскладки, упрощающие набор кода.
Примеры оптимального расположения букв
Ниже представлен пример оптимального расположения букв на клавиатуре ЙЦУКЕН:
Таблица 5. Оптимальное расположение букв на клавиатуре ЙЦУКЕН
| Л | Ф | М | И | Д | Ь | В | У | Я | |
|---|---|---|---|---|---|---|---|---|---|
| Г | Ч | С | Н | Т | О | Щ | Е | С | |
| П | Р | Ы | А | В | Э | К | Л | И | |
| Й | Ц | У | К | Е | Н | Г | Ш | Б |
Это расположение букв основано на частоте их использования и анатомии руки. Оно позволяет повысить скорость набора текста.
Заключение
Оптимизация скорости набора текста на клавиатуре — это важная задача для всех, кто работает с текстом. Правильное расположение букв с учетом частоты их использования и анатомии руки может повысить скорость набора на несколько десятков процентов. Выбор оптимальной клавиатуры, соответствующей вашим потребностям, также может улучшить вашу производительность.
Надеюсь, что эта статья помогла вам понять, как оптимизировать скорость набора текста на русской клавиатуре. Пользуйтесь этими знаниями для повышения своей эффективности в работе с текстом.
Оптимизация расположения клавиш на русской клавиатуре
Как уже было сказано, чередование рук при наборе текста позволяет значительно увеличить скорость печати. В среднем, время нажатия клавиш на разных сторонах клавиатуры (разными руками) составляет 65 миллисекунд, в то время как время нажатия клавиш на одной стороне (одной рукой) составляет 112 миллисекунды. Таким образом, чередование рук ускоряет набор текста на 1,7 раза.
В данной статье я рассмотрю оптимизацию расположения клавиш на русской клавиатуре. Целью оптимизации является расположение наиболее часто используемых биграмм (последовательностей из двух букв) таким образом, чтобы они набирались разными руками.
Для этого я провел двоичный (бинарный) поиск минимума целевого показателя с помощью перестановок букв на первую и вторую половины клавиатуры размерами 15 и 18 клавиш соответственно. Полученное расположение букв обеспечивает наибольшее чередование рук – 84,3% от всех нажатий (против 68% у стандартной клавиатуры).
Расположение букв для левой и правой половин клавиатуры следующее:
Левая сторона: а е ё и о с у ф ш ъ ы ь э ю я
Правая сторона: б в г д ж з й к л м н п р т х ц ч щ
Такое расположение обеспечивает наибольшее чередование между гласными и согласными буквами. Причиной такого распределения является большее количество согласных букв в русском алфавите (21 согласная против 10 гласных). Гласные буквы чередуются чаще с согласными, поэтому на сторону гласных попали согласные с ф и ш, которые особым образом чередуются с согласными и реже с гласными.
Теперь давайте рассмотрим выбор правой или левой стороны для гласных и согласных букв.
Обоснование сопоставления сторон клавиатуры с гласными и согласными буквами
На трехрядной клавиатуре одной рукой приходится нажимать на тройку клавиш больше, чем другой рукой. Поэтому логично отдать более сложную для набора половину более быстрой руке (правой в моем случае). На первый взгляд кажется, что сложнее сторона с 18 буквами и она должна быть справа, как у стандартной клавиатуры. Однако, сторона с 15 клавишами сложнее. Кроме того, не стоит забывать про мышь, с которой приходится работать правой рукой. Если на правой половине будет 15 клавиш, то рука будет сразу рядом с мышкой, что уменьшает дистанцию, которую рука должна преодолеть до нее. Также стоит учесть перспективное направление в развитии клавиатур, такое как использование встроенного трекбола, тачпада или оптического сенсора (клаво-мышь) вместо обычной мышки. В этом случае правая сторона клавиш должна быть компактнее левой.
Дополнительным фактором выбора стороны для гласных и согласных является частое использование мыши совместно с клавиатурой. Левая рука обычно покоится на клавиатуре и нажимает командные комбинации, состоящие в основном из согласных букв.
Подбор расположения клавиш для правой и левой половин
Таким образом, выбрав сторону для гласных и согласных букв, можно сократить перебор возможных вариантов. Для левой половины перебор сократится до 9! перестановок, а для правой половины до 8! перестановок. Такое расположение обеспечивает 66% нажатий на основном ряду и равномерный баланс между пальцами.
Однако, всегда есть возможность сомневаться в выборе. Поэтому я решил убедиться в правильности выбора букв на основном ряду на предшествующих этапах оптимизации.
Среднее время набора текста с оптимизированной клавиатурой значительно сокращается
Оптимизированной клавиатурой я пользуюсь уже более года, и за это время она доказала свою эффективность. В период переобучения, который занял всего два месяца, я освоил новую клавиатуру и теперь печатаю на ней с уверенностью и меньшим количеством ошибок.
Возможно, на первый взгляд кажется, что буквы ъ и ё занимают слишком удобное положение, но на самом деле они разгружают самые нагруженные пальцы на клавиатуре. Если вам нужно отдельное расположение клавиш для точки и запятой, то лучше поменять их местами с буквами ъ и ё. Я использую сочетания клавиш тн и ао для ввода точки и запятой. Благодаря оптимальному расположению букв у меня нет случайных срабатываний сочетаний клавиш.
Преимущества оптимизированной клавиатуры
Оптимизация клавиатуры имеет ряд преимуществ, которые стоит учитывать:
Уменьшение времени набора текста: среднее время набора буквы на стандартной клавиатуре ЙЦУКЕН составляет 80,7 мс, в то время как на оптимальной клавиатуре среднее время набора буквы составляет всего 67,5 мс. Это позволяет сократить время набора текста на 16%.
Экономия времени в долгосрочной перспективе: в зависимости от объема текста, который вы набираете ежедневно, можно рассчитать, сколько времени экономится в год активного использования оптимизированной клавиатуры. Например, если вы набираете 1000 слов или две страницы текста в день, то за год вы сэкономите целых 8 часов времени благодаря оптимальному расположению букв.
Оптимизация клавиатуры — это не только улучшение вашей печатной скорости, но и экономия времени. Если вы хотите стать более эффективным в наборе текста, рекомендуется рассмотреть возможность использования оптимизированной клавиатуры.





