Что такое регулярные выражения
Перейти к содержимому

Что такое регулярные выражения

  • автор:

Регулярные выражения в Loginom

Регулярные выражения — мощный инструмент, позволяющий выполнять сложные операции со строками, такие как извлечение данных, валидация, замена или разделение текстовой информации. В статье рассмотрим их применение в Loginom и примеры задач, для которых лучше использовать другие механизмы.

В работе с данными часто требуется выполнение сложных операций со строками. Типичная задача — исправление ошибок, допущенных людьми при заполнении форм или объединение информации из нескольких источников данных.

Например, база данных содержит коды товаров «А101» и «А102», которые должны быть заменены на единый код — «В100». Один из вариантов решения — применение регулярного выражения, при помощи которого данное действие можно выполнить за один шаг.

Для работы с регулярными выражениями необходимо знать их синтаксис. Существует множество сайтов c его описанием и приложений, помогающих создать корректные выражения, например, regex101.com. Плохо написанные регулярные выражения могут снизить производительность, не исключена потеря данных, поэтому этот инструмент стоит использовать с осторожностью.

Синтаксис регулярных выражений

Регулярное выражение — это последовательность символов, написанных по определенным правилам. Чаще всего их используют для поиска и замены с учетом сложных условий. Фактически регулярное выражение — это однострочная программа.

Регулярные выражения интегрированы в различные языки программирования и популярные инструменты, что приводит к разнообразию синтаксиса. Однако основные правила их составления похожи. Рассмотрим некоторые из них.

Применение символов

Квадратные скобки представляют собой элементарное регулярное выражение, которое образует подмножество символов.

  • [абм] — буква «а» или «б» или «м».
  • [m,k t] — «m», «k», «t», запятая или пробел.
  • [19] — цифра 1 или 9.

Диапазон задается, когда между символами появляется «-».

  • [0-4] — соответствует диапазону от 0 до 4.
  • [а-яА-ЯёЁ] — соответствует всем буквам кириллицы.
  • [A-Za-z] — соответствует всем буквам латинского алфавита.

Исключение символов — если внутри квадратных скобок записать циркумфлекс (каретка) «^». Так, выражению [^reg] соответствует любой символ, кроме «r», «e» и «g».

Начало и конец строки задаются символами каретки ^ и доллара $ . Они называются «якоря». Каретка означает совпадение с началом текста, а доллар — с концом. Например, выбор первой буквы ( ^m — mmmm) и последней ( m$ — mmmm). Выражение ^..$ используется для проверки того, что строка полностью соответствует заданному шаблону.

Метасимволы и квантификаторы

Метасимволы — это специальные символы, которые имеют особое значение и функцию при работе с регулярными выражениями: . ^ $ * + ? < >[ ] \ | ( ) .

Чтобы использовать метасимволы как обычные символы, их необходимо экранировать, добавляя «\» перед ними.

Количество вхождений символов в строку задается с помощью квантификаторов. Это специальный ограничитель, который указывает количество возможных повторений символа, группы или класса символов, находящихся в регулярном выражении перед ним: — n вхождений символов в строку. — n или более вхождений, а — не менее n и не более m.

Например, ^[0-9]$ соответствует двум вхождениям любой цифры.

Некоторые часто используемые конструкции получили в языке регулярных выражений специальные обозначения:

  • * — ноль или большее число вхождений символов в строку. Эквивалентно комбинации ;
  • + — одно или большее число вхождений символов в строку. Эквивалентно комбинации ;
  • ? — ни одного или одно вхождение символов в строку. Эквивалентно комбинации .

Например, выражение Петровa? будет соответствовать строкам, которые начинаются с «Петров» и могут далее иметь символ «a».

Все квантификаторы являются «жадными», т.е. при поиске соответствия ищется самая длинная подстрока, соответствующая шаблону, и не учитываются более короткие.

Некоторые квантификаторы имеют две версии:

  • Жадная версия. Данный квантификатор пытается найти максимально возможное число соответствий элемента.
  • Нежадная (ленивая) версия. При использовании нежадных идентификаторов предпринимается попытка найти минимально возможное число соответствий элемента.

Можно превратить жадный квантификатор в отложенный квантификатор, добавив ? . Например, — соответствует любому символу, один или несколько раз найденному между .

Стоит отметить, что использованный шаблон можно размещать внутри круглых скобок, когда необходима группировка фрагментов. Часть шаблона можно заключить в скобки (. ) . Это называется «скобочная группа».

Без скобок шаблон ma+ означает символ m и идущий после него символ a , который повторяется один или более раз. Например, maaa или maaaaaaa . Скобки группируют символы вместе. Так что (ma)+ означает ma , mama и так далее.

Круглые скобки группируют вместе часть регулярного выражения, так что квантификатор применяется к ним в целом. Скобочные группы нумеруются слева направо.

Можно исключить скобочную группу из запоминания, добавив в ее начало (. ) . То есть, она позволяет применять квантификаторы и другие операторы к части шаблона, но не создает отдельную группу для сохранения найденного текста.

Например, регулярное выражение: «(?:[0-9]-)[0-9]-[0-9]» соответствует шаблону СНИЛСа («723-086-67890»), но не сохраняет первую группу (три цифры и дефис) в отдельную захватывающую группу.

Поиск слова с различным окончанием может быть описан так: (?:бел(?:ая|ый)) . Результат: белая, белый, но не белОЕ.

Также в регулярных выражениях существуют специальные классы символов. Они упрощают поиск определенных типов символов в тексте. Специальные классы символов позволяют сократить запись в регулярных выражениях и делают их более читаемыми. Например, \d соответствует любой последовательности из трех цифр, а \w+ соответствует любому слову (последовательности букв, цифр или символов подчеркивания).

Владение регулярными выражениями — это ценный навык. Они позволяют реализовать сложную и тонкую обработку текста буквально в одну строку, не прибегая к написанию кода на языке программирования. В данном разделе приведен всего лишь краткий обзор синтаксиса. Более подробно с ним можно познакомиться здесь.

Далее рассмотрим применение регулярных выражений в компоненте Калькулятор платформы Loginom.

Регулярные выражения в Loginom

В платформе Loginom используется библиотека PCRE2 (Perl Compatible Regular Expressions 2). Она позволяет использовать регулярные выражения в стиле Perl с некоторыми отличиями. Синтаксис PCRE2 мощнее и гибче, чем стандартные регулярные выражения POSIX.

При работе в Калькуляторе в режиме JavaScript доступны регулярные выражения данного языка, с отличающимся от синтаксиса PCRE2. Подробнее о регулярных выражениях с JavaScript можно прочитать здесь.

С помощью регулярных выражений на платформе Loginom можно решить следующие задачи:

  • поиск и гибкая замена;
  • подготовка и обработка данных;
  • минимизация написания кода и другие.

Для их решения можно воспользоваться встроенными функциями Калькулятора:

  • RegExEmail. Извлекает Email-адрес из строки.
  • RegExDomain. Извлекает адрес веб-сайта из строки.
  • RegExMatch. Осуществляет проверку строки на соответствие регулярному выражению.
  • RegExMatchedExp. Возвращает часть строки, соответствующую регулярному выражению.
  • RegExMatchCount. Возвращает число фрагментов строки, соответствующих заданному регулярному выражению.
  • RegExMatchedNamedSubExp. Возвращает группу части строки, соответствующую регулярному выражению.
  • RegExMatchedSubExp. Извлекает группу фрагмента строки, соответствующую заданному регулярному выражению.
  • RegExReplace. Заменяет определенную часть вхождений подстроки или символа в строке на другую подстроку или символ.
  • RegExReplaceAll. Возвращает строку, в которой все вхождения регулярного выражения будут заменены на строку замены.

Также регулярные выражения применяются в компоненте Замена. Компонент заменяет данные исходного набора, используя таблицы замен.

Поиск и замена осуществляются по:

  • точному совпадению;
  • регулярному выражению.

Для повышения производительности используется кэш скомпилированных регулярных выражений на уровне всего приложения, а не сессии. Кэш хранит шаблоны регулярных выражений, которые используются только при вызове функций. Это устраняет потребность в повторном разборе выражения при каждом его использовании, что уменьшает время обработки.

По умолчанию кэшируется до 16 скомпилированных регулярных выражений. При превышении числа предварительно скомпилированных регулярных выражений из кэша удаляется самое старое по использованию и добавляется новое.

В связи с тем, что регулярные выражения необходимо компилировать, их применение может снизить скорость выполнения программы и увеличить потребление памяти. Однако, в платформе Loginom есть альтернативные возможности работы со строками, которые могут быть более эффективными в некоторых случаях.

Когда стоит избегать написания регулярных выражений

Регулярные выражения — мощный инструмент для обработки текстовых данных, но они не всегда являются оптимальным выбором. Когда речь идет о простых операциях, таких как поиск конкретных слов или фраз, замена текста, извлечение подстрок, регулярные выражения будут избыточными. Вместо того, чтобы создавать сложные шаблоны, иногда более понятным и эффективным решением будет использование строковых функций, встроенных в Loginom.

Замена целиком строки или слова

Для замены строки нет необходимости в регулярных выражениях. В Loginom есть компонент Замена. Замену можно произвести по точному значению. Например, номеру телефона или паспортным данным.

Если в строке есть слово, которое необходимо заменить, в частности, код товара, можно применить функцию Replace в Калькуляторе. Передаем следующие параметры: Replace(Name,»А101″,»В101″, true, true).

Проверка даты

Для проведения проверки даты можно применить регулярное выражение, как пример:

Синтаксис непростой и при написании легко допустить ошибку. В Калькуляторе представлена функция StrToDate, которая справится с этой задачей без самостоятельного написания регулярного выражения. Функция конвертирует строку, содержащую дату, в формат типа «Дата и Время». Вид можно задать по своему усмотрению.

Выделение подстроки

Для извлечения символов из строки без учета того, будут это буквы или цифры, можно воспользоваться функциями Калькулятора Right или Left. Необходимо передать нужное количество символов.

В компоненте Калькулятор есть возможность извлечь подстроку из строки с определенной позиции и нужной длины. Для этого стоит воспользоваться функцией SubStr.

Готовые регулярные выражения

В интернете есть уже готовые регулярные выражения для проверки электронной почты, их синтаксис очень сложный. Самостоятельно писать регулярные выражения не надо, т.к. можно воспользоваться функцией RegExEmail в компоненте Калькулятор. В нее только необходимо передать нужный параметр.

Кроме того в Калькулятор встроена функция для проверки домена RegExDomain. Шаблон регулярного выражения доменного имени самостоятельно писать не требуется.

Однако не все задачи по обработке строк можно решить при помощи простых функций. При решении нетривиальных задач регулярные выражения являются оптимальным выбором. Рассмотрим некоторые кейсы, в которых можно применять регулярные выражения на платформе Loginom, используя компонент Калькулятор.

Регулярные выражения для нетривиальных задач

Кейс 1 — удаление лишних символов

Используем функцию: RegExReplaceAll.

  • символы . и ; , которые необходимо удалить;
  • поле «Name»;
  • строка, которая будет вставлена вместо части входной строки, в данном случае это пустота.

В результате появляется новый столбец с обновленными значениями, из которых исключены лишние символы.

Можно использовать другое регулярное выражение: [^(а-я)|^(А-Я)|(\s)] . Останутся только строчные буквы, заглавные буквы и пробелы, а все остальные символы будут удалены.

Кейс 2 — поиск заданных строк

В базе следующие данные.

Необходимо узнать, какие препараты представлены в упаковках по 10 или 30 грамм. Воспользуемся функцией RegExMath . Передаем следующие аргументы: RegExMatch(«((10)|(30)) г», Name) .

Кейс 3 — валидация номеров телефонов

Одним из решений, является применение функции с аргументами. RegExMatchedExp(«^((\+?7|8)[\-]?)?((\([0-9]\))|([0-9]))?([\-])?([0-9][\-]?[0-9][\-]?[0-9])$», Phone) .

Она возвращает только те номера, которые прошли верификацию.

Кейс 4 — выделение фамилии

Фамилия и паспортные данные находятся в одном столбце. Необходимо их разделить.

Для получения фамилии, воспользуемся функцией RegExMatchedExp. Она возвращает часть строки, соответствующую регулярному выражению.

В нашем примере: RegExMatchedExp(«[А-Я][а-яё]», Name) .

Это регулярное выражение означает, что фамилия начинается с заглавной буквы, остальные символы строчные. Наибольшая длина — 50 символов. Обратите внимание: «ё» не входит в интервал «а-я», поэтому ее необходимо указывать отдельно.

Кейс 5 — выделение номера договора

Номер договора содержит лишние символы и дату. Разделим строку на номер договора и дату подписания.

Номер договора получаем через функцию RegExMatchedExp и регулярного выражения [0-9]+ . Дату с помощью двух функций: Right и StrToDate .

Кейс 6 — поиск вхождения строк

В наших данных есть информация о вспомогательных веществах препарата. Необходимо узнать, где присутствует «желатин» или «сахароза». Воспользуемся функцией RegExMatch, она проверяет соответствие строки регулярному выражению. Зададим поля: RegExMatch(«(желатин)|(сахароза)», substance) . Получаем результат.

Регулярные выражения, представленные в кейсах, не являются эталоном, а скорее, демонстрируют примеры и подходы к решению конкретных задач. Одни и те же выражения можно написать несколькими способами, сохраняя при этом одинаковую функциональность.

Регулярные выражения обеспечивают гибкость в выборе синтаксиса и комбинаций элементов, которые используются для поиска и обработки текста. Важно понимать, что хотя разные выражения могут давать одинаковый результат для задачи, некоторые варианты могут быть более эффективными с точки зрения производительности или читаемости.

Когда применять регулярные выражения

Применение сложных регулярных выражений к большому объему данных, может замедлить выполнение, так как для их работы программе нужно выполнить множество операций. Время выполнения увеличивается пропорционально количеству записей.

На небольшом наборе данных разница не ощущается, но с увеличением выборки различие в производительности может стать заметным. Однако, если простые функции обработки строк не способы решить задачу, то имеет смысл использовать регулярные выражения на платформе Loginom.

Для большинства пользователей регулярные выражения кажутся очень сложными, но существуют различные сервисы для онлайн тестирования. Здесь можно посмотреть документацию и различные примеры.

Работа с регулярными выражениями на платформе Loginom имеет свои плюсы и минусы.

  • решение нетривиальных задач обработки текстов;
  • относительно быстрая скорость выполнения;
  • сложная обработка текстов без написания кода на языках программирования;
  • наличие готовых регулярных выражения для проверки e-mail-адресов и доменов.
  • специфичный синтаксис, сложный для понимания пользователей без опыта использования;
  • весьма вероятно наличие потенциальных ошибок, которые требуют тщательного тестирования выражений;
  • снижение скорости обработки по сравнению со встроенным функциями;
  • ограниченная функциональность по сравнению с языками программирования.

Регулярные выражения — мощный инструмент для работы с текстом, при условии грамотного применения. Использование дополнительных инструментов и сервисов для их создания облегчает работу. Для решения нетривиальных задач обработки строк он может быть предпочтительней написания кода, т.к. синтаксис регулярных выражений проще языков программирования. Но несмотря на это, данный инструмент все равно требует осторожного применения.

Дополнительные материалы:

Что такое регулярные выражения и как их использовать

Регулярное выражение — это последовательность специальных символов, формирующих паттерн или шаблон, который сопоставляется со строкой.

Цель такого сопоставления может состоять, например, для определении соответствия строки шаблону для валидации строки.

Использование специальных символов

Регулярные выражения являются регистрозависимыми. Например: для заполнения полей в верхнем и нижнем регистре необходимо использовать регулярное выражение, которое будет проверять введённую туда информацию.

Символы и метасимволы, используемые при формировании регулярного выражения

Символ

Значение

Начало строки (означает, что входная строка должна начинаться с последующего символа после этого. Внутри [] также используется для исключения какого-либо символа

Конец строки (означает что все условия до этого символа буду являться конечным результатом входной строки и после них ничего дальше нет)

Позволяет ввести один любой символ

Означает что предыдущее условие до данного символа должно встречаться один и более раз (соответственно, может повторятся)

Позволяет ввести точку в строке

Означает конец слова и позволяет настроить ввод определенного слова, которое указано метасимвола

Исключает поиск по заданному слову после метасимвола

Эквивалентен выражению [0-9] и позволяет ввести любую цифру

Эквивалентен выражению [^0-9] и исключает возможность ввода цифр

Эквивалентен выражению [[:word:]] и позволяет ввести знак подчеркивания (_) буквенный (латиница) или цифровой символы

Эквивалентен выражению [^[:word:]] и исключает возможность ввода знака подчеркивания (_) или буквенного (латиница) или цифрового символов

Операция ИЛИ. Позволяет перечислить допустимые значения в строке (целые слова или несколько символов подряд). Должно выполнится условие слева или условия справа от этой операнды

Используется для диапазона допустимых значений, внутри скобок указываем набор допустимых значений. Распространенные диапазоны: [А-Я] — все заглавные русские буквы, [А-Яа-яЁё] — все русские буквы, [a-zA-Z] — все буквы латиницы, [0-9] — любая цифра. Если необходимо указать узкий набор букв или символов, которые можно ввести в строку (например: буквы «абв»), то вносим это значение в квадратные скобки. Между перечисляемыми вариантами ввода не нужно использовать какие-либо разделители (пробел или запятая)

Используется для обозначения группы символов. Внутри круглых скобок мы перечисляем доступные для фильтрации символы

Дефис является единственным допустимым разделителем внутри регулярного выражения и позволяет задать диапазон. ВАЖНО: в диапазоне необходимо учитывать, что для начала и окончания учитывается один символ ([1-45] будет учитывать диапазон только между 1 и 4, а не между 1 и 45)

Регулярные выражения

Типовые регулярные выражения

Название

Описание

Регулярное выражение

Проверка корректности электронной почты

Ориентировано на российские мобильные и городские номера с кодом из 3-х цифр

Отрабатываются все домены, кроме .рф

Проверка поля на ввод только целого числа

Ввод только на кириллице

Ввод только на латинице

Применение в конструкторе

Настройка валидации у компонента находится в блоке «Правила валидации».

Для того, чтобы использовать регулярное значение — необходимо указать его в поле «Регулярное выражение». При указанном значении будет происходить сравнение введённого значения пользователем с регулярным выражением. При несовпадении значений на форме будет выводиться ошибка, текст для которой можно задать в поле «Сообщение об ошибке, отображаемое если правило валидации не выполняется».

Регулярные выражения

Регулярные выражения — это шаблоны, используемые для сопоставления последовательностей символов в строках. В JavaScript регулярные выражения также являются объектами. Эти шаблоны используются в методах exec (en-US) и test (en-US) объекта RegExp (en-US) а также match (en-US) , replace , search (en-US) , split (en-US) объекта String . Данная глава описывает регулярные выражения в JavaScript.

Создание регулярного выражения

Регулярное выражение можно создать двумя способами:

    Используя литерал регулярного выражения, например:

var re = /ab+c/; 
var re = new RegExp("ab+c"); 

Написание шаблона регулярного выражения

Шаблон регулярного выражения состоит из обычных символов, например /abc/ , или комбинаций обычных и специальных символов, например /ab*c/ или /Chapter (\d+)\.\d*/ . Последний пример включает в себя скобки, которые используются как «запоминающий механизм». Соответствие этой части шаблона запоминается для дальнейшего использования, как описано в Использование совпадений подстрок заключённых в скобки.

Использование простых шаблонов

Простые шаблоны используются для нахождения прямого соответствия в тексте. Например, шаблон /abc/ соответствует комбинации символов в строке только когда символы ‘abc’ встречаются вместе и в том же порядке. Такое сопоставление произойдёт в строке «Hi, do you know your abc’s?» и «The latest airplane designs evolved from slabcraft.» В обоих случаях сопоставление произойдёт с подстрокой ‘abc’. Сопоставление не произойдёт в строке «Grab crab», потому что она не содержит подстроку ‘abc’.

Использование специальных символов

В случае когда поиск соответствия требует чего-то большего, чем прямое сопоставление, например нахождение последовательности символов ‘b’ или нахождение пробела, шаблон включает в себя специальные символы. Например, шаблон /ab*c/ соответствует любой комбинации символов, в которой за ‘a’ следует ноль или более символов ‘b’ ( * означает ноль или более вхождений предыдущего символа), за которыми сразу же следует символ ‘c’. В строке «cbbabbbbcdebc,» этому шаблону сопоставляется подстрока ‘abbbbc’.

В следующей таблице приводится полный список специальных символов регулярных выражений с их описаниями.

  • Для символов обычно обрабатываемых буквально, означает что следующий символ является специальным и не должен интерпретироваться буквально.
  • Например, /b/ сопоставляется символу ‘b’. Добавляя слеш перед b, т.е используя /\b/ , символ становится специальным символом, означающим границу слова.
  • Для символов обычно обрабатываемых особым образом означает, что следующий символ не является специальным и должен интерпретироваться буквально.
  • Например, * является специальным символом, сопоставляемым 0 или более повторений предыдущего символа; например, /a*/ означает соответствие 0 или более символов а. Для буквальной интерпретации *, поставьте перед ней обратный слеш; например, /a\*/ соответствует ‘a*’.
  • Также не забудьте заэкранировать сам \ при его использовании в записи new RegExp(«pattern») поскольку \ также является экранирующим символом в обычных строках.

Соответствует началу ввода. Если установлен флаг многострочности, также производит сопоставление непосредственно после переноса строки.

Например, /^A/ не соответствует ‘A’ в «an A», но соответствует ‘A’ в «An E».

Этот символ имеет другое значение при появлении в начале шаблона набора символов.

Например, /[^a-z\s]/ соответствует ‘I’ в «I have 3 sisters».

Соответствует концу ввода. Если установлен битовый флаг многострочности, также сопоставляется содержимому до переноса строки.

Например, /t$/ не соответствует ‘t’ в строке «eater», но соответствует строке «eat».

Соответствует предыдущему символу повторенному 0 или более раз. Эквивалентно .

Например, /bo*/ соответствует ‘boooo’ в «A ghost booooed» и ‘b’ в «A bird warbled», но не в «A goat grunted».

Соответствует предыдущему символу повторенному 1 или более раз. Эквивалентно .

Например, /a+/ соответствует ‘a’ в «candy» и всем символам ‘a’ в «caaaaaaandy».

0 или 1 раз. Эквивалентно .

Например, /e?le?/ соответствует ‘el’ в «angel» и ‘le’ в «angle» а также ‘l’ в «oslo».

Если использован сразу после квалификаторов * , + , ? , или <> , делает квалификатор «нежадным» (соответствующим минимальному количеству символов), в отличие от режима по умолчанию, являющимся «жадным» (соответствующим максимальному числу символов). Например, используя /\d+/ не глобальное сопоставление «123abc» возвращает «123», если использовать /\d+?/, только «1» будет возвращена.

Также используется в упреждающих утверждениях (assertions), описанных в строках x(?=y) и x(?!y) данной таблицы.

(десятичная точка) соответствует любому символу кроме переноса строки.

Например, /.n/ соответствует ‘an’ и ‘on’ в «nay, an apple is on the tree», но не ‘nay’.

Соответствует ‘x’ и запоминает это соответствие. Это называется захватывающие скобки.

Например, /(foo)/ соответствует ‘foo’ в «foo bar.» Сопоставленная строка может быть получена из элементов результирующего массива [1] , . [n] .

Соответствует ‘x’ только если за ‘x’ следует ‘y’. Это называется упреждение.

Например, /Jack(?=Sprat)/ соответствует ‘Jack’ только если за ним следует ‘Sprat’. /Jack(?=Sprat|Frost)/ соответствует ‘Jack’ только если за ним следует ‘Sprat’ или ‘Frost’. Тем не менее, ни ‘Sprat’ ни ‘Frost’ не являются частью сопоставленного результата.

Соответствует ‘x’ только если за ‘x’ не следует ‘y’. Это называется отрицательное упреждение.

Например, /\d+(?!\.)/ соответствует числу только если за ним не следует десятичная точка. Регулярное выражение /\d+(?!\.)/.exec(«3.141») сопоставит ‘141’ но не ‘3.141’.

Соответствует либо ‘x’ либо ‘y’.

Например, /green|red/ соответствует ‘green’ в «green apple» и ‘red’ в «red apple.»

n — положительное целое. Соответствует ровно n вхождениям предыдущего символа.

Например, /a/ не соответствует ‘a’ в «candy,» но соответствует всем а в «caandy,» первым двум а в «caaandy.»

m и n — положительные целые. Соответствует как минимум n и максимум m вхождениям предыдущего символа. При m=n=1 пропускается.

Например, /a/ ничему не соответствует в строке «cndy», символу ‘a’ в «candy,» двум а в «caandy,» и трём первым а в «caaaaaaandy». Отметим, что при сопоставлении «caaaaaaandy», совпадает «aaa», хотя изначальная строка содержит больше а.

Набор символов. Соответствует любому символу из перечисленных. Можно указать диапазон символов, используя тире. Специальные символы (как точка ( . ) и звёздочка ( * )) не имеют специального значения внутри такого набора. Их не надо экранировать. Экранирование работает также.

Например, [abcd] эквивалентна [ a-d] . Они соответствуют ‘b’ в «brisket» и ‘c’ в «city». /[a-z.]+/ и /[\w.]+/ обе соответствуют всему в «test.i.ng».

Инвертированный или дополняющий набор символов. Это означает соответствие всему, что не в скобках. Можно указать диапазон символов с помощью тире. Все, что действует в обычном наборе символов, действует и здесь.

Например, [^abc] эквивалентно [^a-c] . Они соответствуют изначально ‘r’ в «brisket» и ‘h’ в «chop.»

Соответствует границе слова. Граница слова соответствует позиции, где за символом слова не следует другой символ слова или предшествует ему. Отметим, что граница слова не включается в соответствие. Другими словами, длина сопоставленной границы слова равна нулю. (Не путать с [\b] .)

Примеры:
/\bmoo/ соответствует ‘moo’ в слове «moon» ;
/oo\b/ не соответствует ‘oo’ в слове «moon», поскольку за ‘oo’ следует символ ‘n’ , являющимся символом слова;
/oon\b/ соответствует ‘oon’ в слове «moon», поскольку ‘oon’ является окончанием строки, и таким образом, за этими символами не следует другой символ слова;
/\w\b\w/ никогда не будет ничему соответствовать, поскольку за символом слова никогда не может следовать и граница слова, и символ слова.

Note: JavaScript’s regular expression engine defines a specific set of charactersto be «word» characters. Any character not in that set is considered a word break. This set of characters is fairly limited: it consists solely of the Roman alphabet in both upper- and lower-case, decimal digits, and the underscore character. Accented characters, such as «é» or «ü» are, unfortunately, treated as word breaks.

Соответствует несловообразующей границе. Несловообразующая граница соответствует позиции, в которой предыдущий и следующий символы являются символами одного типа: либо оба должны быть словообразующими символами, либо несловообразующими. Начало и конец строки считаются несловообразующими символами.

Например, /\B../ соответствует ‘oo’ в слове «noonday» (, а /y\B./ соответствует ‘ye’ в «possibly yesterday.»

Где X является символом случайного выбора из последовательности от А до Я. Соответствует управляющему символу в строке.

Например, /\cM/ соответствует control-M (U+000D) в строке.

Соответствует цифровому символу. Эквивалентно выражению [0-9] .

Например, /\d/ or /[0-9]/ соответствует ‘2’ в «B2 is the suite number.»

Соответствует любому нецифровому символу. Эквивалентно выражению [^0-9] .

Например, /\D/ or /[^0-9]/ соответствует ‘B’ в предложении «B2 is the suite number.»

Соответствует символу прогона страницы (U+000C). Особый символ управления печатью.

Соответствует одиночному символу пустого пространства, включая пробел, табуляция, прогон страницы, перевод строки. Эквивалентен [ \f\n\r\t\v\u00A0\u1680\u180e\u2000\u2001\u2002\u2003\u2004\u2005\u2006\u2007\u2008\u2009\u200a\u2028\u2029\u2028\u2029\u202f\u205f\u3000] .

Например, /\s\w*/ совпадает с ‘ bar’ в «foo bar.»

Соответствует одиночному символу непустого пространства. Эквивалентен [^ \f\n\r\t\v\u00A0\u1680\u180e\u2000-\u200a\u2028\u2029\u202f\u205f\u3000] .

Например, /\S\w*/ совпадает с ‘foo’ в «foo bar.»

Соответствует любому цифробуквенному символу включая нижнее подчёркивание. Эквивалентен [A-Za-z0-9_] .

Например, /\w/ совпадает с ‘a’ в «apple,» ‘5’ в «$5.28,» и ‘3’ в «3D.»

Соответствует любому не цифробуквенному символу. Равносилен [^A-Za-z0-9_] .

Например, /\W/ or /[^A-Za-z0-9_]/ совпадает с ‘%’ в «50%.»

Где n это положительное целое, обратная ссылка на последнюю найденную подстроку, соответствующую n , заключённую в круглые скобки в регулярном выражении (считая левые скобки).

Например, /apple(,)\sorange\1/ соответствует ‘apple, orange,’ в «apple, orange, cherry, peach.»

Экранирование пользовательского ввода, соответствующего буквенной строке внутри регулярного выражения, может быть достигнуто простой заменой:

function escapeRegExp(string)  return string.replace(/[.*+?^$<>()|[\]\\]/g, "\\$&"); // $& means the whole matched string > 

Использование скобок

Скобки вокруг любой части регулярного выражения означают что эта часть совпадаемой подстроки будет запомнена. Раз запомнена, подстрока может выбрана для использования как это описано в Using Parenthesized Substring Matches.

Например, паттерн /Chapter (\d+)\.\d*/ включает в себя дополнительные экранирующие и специальные символы и указывает на то, что часть шаблона должна быть запомнена. Он точно соответствует символам слова ‘Chapter ‘, за которыми следует один или более цифровых символов ( \d означает любой цифровой символ, а ‘ +’ означает 1 или более раз), за которым следует десятичная точка (сама по себе являющаяся специальным символом; предшествующий десятичной точке слеш ‘ \’ означает, что паттерн должен искать литеральный символ ‘.’), после которой следует любой цифровой символ 0 или более раз (‘ \d’ обозначает цифровой символ, ‘ *’ обозначает 0 или более раз). Кроме того, круглые скобки используются для запоминания первых же совпавших цифровых символов.

Этот шаблон будет найден во фразе «Open Chapter 4.3, paragraph 6» и цифра ‘4’ будет запомнена. Но он не будет найден во фразе «Chapter 3 and 4», поскольку эта строка не имеет точки после цифры ‘3’.

Для того, чтобы сопоставить подстроку без вызова совпавшей части для запоминания, внутри круглых скобок необходимо предварить паттерн сочетанием символов ‘ ?:’ . Например, шаблон (?:\d+) будет соответствовать одному или более цифровому символу, но не запомнит совпавших символов.

Работа с Регулярными Выражениями

Регулярные выражения используются в методах test и exec объекта RegExp и с методами match , replace , search , и split объекта String . Эти методы подробно объясняются в Справочнике JavaScript

Метод Описание
exec (en-US) Метод RegExp, который выполняет поиск совпадения в строке. Он возвращает массив данных.
test (en-US) Метод RegExp , который тестирует совпадение в строке. Возвращает либо истину либо ложь.
match (en-US) Метод String , который выполняет поиск совпадения в строке. Он возвращает массив данных либо null если совпадения отсутствуют.
search (en-US) Метод String, который тестирует на совпадение в строке. Он возвращает индекс совпадения, или -1 если совпадений не будет найдено.
replace Метод String , который выполняет поиск совпадения в строке, и заменяет совпавшую подстроку другой подстрокой, переданной как аргумент в этот метод.
split (en-US) Метод String, который использует регулярное выражение или фиксированную строку чтобы разбить строку на массив подстрок.

Чтобы просто узнать есть ли в строке что либо соответствующее шаблону, воспользуйтесь методами test или search ; а чтобы получить больше информации пользуйтесь методами exec или match (хотя эти методы работают медленнее). Если вы пользуетесь exec или match и если совпадения есть, эти методы вернут массив и обновлённые свойства объекта ассоциированного регулярного выражения а также предопределённого объекта RegExp регулярного выражения. Если совпадений нет, метод exec вернёт null (который сконвертируется в false ).

В след. примере, скрипт использует метод exec чтобы найти совпадения в строке.

var myRe = /d(b+)d/g; var myArray = myRe.exec("cdbbdbsbz"); 

Если вам не нужен доступ к свойствам регулярного выражения, то альтернативный способ получить myArray можно так:

var myArray = /d(b+)d/g.exec("cdbbdbsbz"); 

Если вы хотите сконструировать регулярное выражение из строки, другой способ сделать это приведён ниже:

var myRe = new RegExp("d(b+)d", "g"); var myArray = myRe.exec("cdbbdbsbz"); 

С помощью этих скриптов, поиск совпадения завершается и возвращает массив и обновлённые свойства показанные в след. таблице.

Table 4.3 Результаты выполнения регулярного выражения

Объект Свойство или индекс Описание В этом примере.
myArray Совпавшая строка и все запомненные подстроки. [«dbbd», «bb»]
index Индекс совпавшей подстроки (индекс начинается с нуля). 1
input Исходная строка. «cdbbdbsbz»
[0] Последние совпавшие символы. «dbbd»
myRe lastIndex Индекс с которого начнётся след. поиск совпадения. (Это свойство определяется только если регулярное выражение использует параметр g, описанный в [Advanced Searching With Flags](#Advanced_Searching_With_Flags).) 5
source Текст шаблона. Обновляется в момент создания регулярного выражения, а не во время выполнения. «d(b+)d»

Как показано во втором варианте этого примера, вы можете использовать регулярное выражение, созданное при помощи инициализатора объекта, без присваивания его переменной. Таким образом, если вы используете данную форму записи без присваивания переменной, то в процессе дальнейшего использования вы не можете получить доступ к свойствам данного регулярного выражения. Например, у вас есть следующий скрипт:

var myRe = /d(b+)d/g; var myArray = myRe.exec("cdbbdbsbz"); console.log("The value of lastIndex is " + myRe.lastIndex); 

Этот скрипт выведет:

The value of lastIndex is 5

Однако, если у вас есть следующий скрипт:

var myArray = /d(b+)d/g.exec("cdbbdbsbz"); console.log("The value of lastIndex is " + /d(b+)d/g.lastIndex); 
The value of lastIndex is 0

Совпадения /d(b+)d/g в двух случаях являются разными объектами регулярного выражения и, следовательно, имеют различные значения для свойства lastIndex . Если вам необходим доступ к свойствам объекта, созданного при помощи инициализатора, то вы должны сначала присвоить его переменной.

Использование скобочных выражений для нахождения подстрок

Использование скобок в шаблоне регулярного выражения повлечёт «запоминание» совпавшей подстроки. Для примера, /a(b)c/ вызовет совпадение ‘abc’ и запомнит ‘b’. Чтобы получить совпадения скобочного выражения используйте Array elements [1] , . [n] .

Число возможных скобочных подстрок неограничено. Возвращаемый массив содержит все полученные совпадения, удовлетворяющие выражению в скобках. Следующий пример показывает как использовать скобочные выражения для нахождения подстрок.

Следующий скрипт использует метод replace(), чтобы поменять местами слова (символы) в строке. Для замены текста скрипт использует обозначения $1 и $2 для обозначения первого и второго совпадения скобочного выражения.

var re = /(\w+)\s(\w+)/; var str = "John Smith"; var newstr = str.replace(re, "$2, $1"); console.log(newstr); 

Выведет «Smith, John».

Расширенный поиск с флагами

Регулярные выражения имеют четыре опциональных флага, которые делают возможным глобальный и регистронезависимый поиск. Флаги могут использоваться самостоятельно или вместе в любом порядке, а также могут являться частью регулярного выражения.

Flag Description
g Глобальный поиск.
i Регистронезависимый поиск.
m Многострочный поиск.
y Выполняет поиск начиная с символа, который находится на позиции свойства lastindex текущего регулярного выражения.

Чтобы использовать флаги в шаблоне регулярного выражения используйте следующий синтаксис:

var re = /pattern/flags; 
var re = new RegExp("pattern", "flags"); 

Обратите внимание, что флаги являются неотъемлемой частью регулярного выражения. Флаги не могут быть добавлены или удалены позднее.

Для примера, re = /\w+\s/g создаёт регулярное выражение, которое ищет один или более символов, после которых следует пробел и ищет данное совпадение на протяжении всей строки.

var re = /\w+\s/g; var str = "fee fi fo fum"; var myArray = str.match(re); console.log(myArray); 

Выведет [«fee «, «fi «, «fo «]. В этом примере вы бы могли заменить строку:

var re = /\w+\s/g; 
var re = new RegExp("\\w+\\s", "g"); 

и получить тот же результат.

Флаг m используется, чтобы входная строка рассматривалась как многострочная. Если флаг m используется, то ^ и $ вызовет совпадение в начале или конце любой строки в строке ввода вместо начала или конца вводимой строки целиком.

Примеры

След. примеры показывают использование регулярных выражений.

Изменение порядка в Исходной Строке

След. пример иллюстрирует формирование регулярного выражения и использование string.split() и string.replace() . Он очищает неправильно сформатированную исходную строку, которая содержит имена в неправильном порядке (имя идёт первым) разделённые пробелами, табуляцией и одной точкой с запятой. В конце, изменяется порядок следования имён (фамилия станет первой) и сортируется список.

// The name string contains multiple spaces and tabs, // and may have multiple spaces between first and last names. var names = "Harry Trump ;Fred Barney; Helen Rigby ; Bill Abel ; Chris Hand "; var output = ["---------- Original String\n", names + "\n"]; // Prepare two regular expression patterns and array storage. // Split the string into array elements. // pattern: possible white space then semicolon then possible white space var pattern = /\s*;\s*/; // Break the string into pieces separated by the pattern above and // store the pieces in an array called nameList var nameList = names.split(pattern); // new pattern: one or more characters then spaces then characters. // Use parentheses to "memorize" portions of the pattern. // The memorized portions are referred to later. pattern = /(\w+)\s+(\w+)/; // New array for holding names being processed. var bySurnameList = []; // Display the name array and populate the new array // with comma-separated names, last first. // // The replace method removes anything matching the pattern // and replaces it with the memorized string—second memorized portion // followed by comma space followed by first memorized portion. // // The variables $1 and $2 refer to the portions // memorized while matching the pattern. output.push("---------- After Split by Regular Expression"); var i, len; for (i = 0, len = nameList.length; i  len; i++)  output.push(nameList[i]); bySurnameList[i] = nameList[i].replace(pattern, "$2, $1"); > // Display the new array. output.push("---------- Names Reversed"); for (i = 0, len = bySurnameList.length; i  len; i++)  output.push(bySurnameList[i]); > // Sort by last name, then display the sorted array. bySurnameList.sort(); output.push("---------- Sorted"); for (i = 0, len = bySurnameList.length; i  len; i++)  output.push(bySurnameList[i]); > output.push("---------- End"); console.log(output.join("\n")); 

Использование спецсимволов для проверки входных данных

В след. примере, ожидается что пользователь введёт телефонный номер и требуется проверить правильность символов набранных пользователем. Когда пользователь нажмёт кнопку «Check», скрипт проверит правильность введённого номера. Если номер правильный (совпадает с символами определёнными в регулярном выражении), то скрипт покажет сообщение благодарности для пользователя и подтвердит номер. Если нет, то скрипт проинформирует пользователя, что телефонный номер неправильный.

Внутри незахватывающих скобок (?: , регуляное выражение ищет три цифры \d ИЛИ | открывающую скобку \( , затем три цифры \d , затем закрывающую скобку \) , (закрывающая незахватывающая скобка ) ), затем тире, слеш, или десятичная точка, и когда это выражение найдено, запоминает символ ([-\/\.]) , следующие за ним и запомненные три цифры \d , следующее соответствие тире, слеша или десятичной точки \1 , и следующие четыре цифры \d .

Регулярное выражение ищет сначала 0 или одну открывающую скобку \(? , затем три цифры \d , затем 0 или одну закрывающую скобку \)? , потом одно тире, слеш или точка и когда найдёт это, запомнит символ ([-\/\.]) , след. три цифры \d , followed by the remembered match of a dash, forward slash, or decimal point \1 , followed by four digits \d .

Событие «Изменить» активируется, когда пользователь подтвердит ввод значения регулярного выражения, нажав клавишу «Enter».

doctype html> html> head> meta http-equiv="Content-Type" content="text/html; charset=ISO-8859-1" /> meta http-equiv="Content-Script-Type" content="text/javascript" /> script type="text/javascript"> var re = /\(?\d \)?([-\/\.])\d \1\d /; function testInfo(phoneInput)  var OK = re.exec(phoneInput.value); if (!OK) window.alert(RegExp.input + " isn't a phone number with area code!"); else window.alert("Thanks, your phone number is " + OK[0]); > script> head> body> p> Enter your phone number (with area code) and then click "Check". br />The expected format is like ###-###-####. p> form action="#"> input id="phone" />button onclick="testInfo(document.getElementById('phone'));"> Check button> form> body> html> 

Found a content problem with this page?

  • Edit the page on GitHub.
  • Report the content issue.
  • View the source on GitHub.

This page was last modified on 7 авг. 2023 г. by MDN contributors.

Регулярные выражения

Регулярные выражения — это инструмент, который позволяет фронтендеру быстрее находить и анализировать информацию. Благодаря ему можно не только эффективнее решать задачи, но и писать код, который будет лучше работать. Причем не стоит использовать этот метод везде: иногда он только усложняет жизнь.

Наше недавнее исследование вакансий показало: знание регулярных выражений и навык работы с ними требуется в 24% вакансий продуктовых компаний для фронтенд-разработчиков с опытом больше двух лет.

Давайте разберёмся, что такое регулярные выражения и как грамотно их применять.

Зачем нужны регулярные выражения

Регулярные выражения — это формальный язык поиска подстроки в строке. Они поддерживаются многими программами: редакторами, системными утилитами, базами данных. Но особенно хорошо возможности этого инструмента раскрываются в языках программирования, в том числе в JavaScript.

Рассмотрим простой пример, чтобы понять, зачем нужны регулярные выражения. Допустим, перед нами стоит задача — найти и заменить местоимение ее на его в строке Быстрее всего мы догоним ее на машине .

Самое очевидное решение — использовать прямую замену, применив встроенную в JavaScript функцию:

'Быстрее всего мы догоним ее на машине'.replace('ее', 'его'); 

Однако мы получим ожидаемо неверный результат: ее является также окончанием слова Быстрее , а .replace() заменит первое вхождение подстроки. Поэтому необходимо проверить строку на наличие символа, стоящего перед ее : если это пробел, можно делать замену.

В задаче могут возникнуть и другие условия. Например, мы не знаем, в каком регистре написаны слова ( ее , Ее , ЕЕ ) и используется ли буква ё . Если добавить их в функцию, она станет слишком большой и сложной. Это может привести к другим ошибкам.

С помощью регулярных выражений подобные задачи решаются гораздо проще. Но фронтенд-разработчики редко используют этот инструмент, потому что он кажется непонятным. Попробуем внести ясность.

�� Чтобы углубиться в тему, пройдите курс «Регулярные выражения для фронтенда». Он научит вас составлять регулярные выражения, чтобы писать меньше кода и работать быстрее.

Когда можно использовать регулярные выражения

Типовых задач, в которых регулярные выражения действительно могут пригодиться, не так много. Среди них:

  • Поиск или замена подстроки в строке с «плавающими» (неизвестными) данными. Самая распространённая задача — найти в тексте ссылки и адреса электронной почты и сделать их кликабельными.
  • Валидация данных формы и ограничение ввода. Например, валидация номера телефона, электронной почты, данных паспорта гражданина РФ и другой информации.
  • Получение части строки или формирование новых структур данных из строк. Например, нужно найти количество вхождений ключевых слов в тексте без учёта падежных окончаний, составить из них массив с данными для дальнейшего использования.

Чаще всего фронтенд-разработчики встречаются с регулярными выражениями в задачах, связанных с валидацией данных. И обычно такие задачи решаются поиском нужного выражения в интернете и вставкой готового выражения в проект — по крайней мере, у начинающих специалистов.

В контексте поиска и замены текста регулярные выражения используют редко, а в сложных кейсах по работе с текстом — ещё меньше. Но они могут помочь, если задача связана с обработкой текста.

Когда нет смысла применять регулярные выражения

В некоторых случаях этот инструмент усложняет реализацию или время выполнения кода. Вам не нужны регулярные выражения, если стандартные функции JavaScript справляются с задачей сами. Вот ещё пара ситуаций:

  • Структура содержимого данных хорошо описана, легко поддаётся разбору, и можно применить нативные методы работы со строкой.
  • Предполагается работа с тегами, правка атрибутов или содержимого.

Разумеется, это общие примеры, и научиться подбирать правильное решение можно только с опытом. Главное, чтобы оно позволяло тратить на задачу меньше ресурсов и повышало производительность.

Как регулярные выражения могут помочь с задачами, которые не касаются написания кода напрямую

Регулярные выражения могут облегчить работу фронтендеру не только при работе с кодом, но и при его написании.

По сути, ваш код — это текст, по которому также можно осуществлять поиск, выполнять ручные и автоматические замены. При работе над большими проектами такие операции надо проводить очень аккуратно, чтобы не удалить ничего лишнего.

Вот пример использования регулярных выражений для поиска в текстовом редакторе:

Какие типовые задачи решаются регулярными выражениями:

  • Поиск и гибкая замена в коде.
  • Подготовка и обработка данных. Когда вы выносите предварительные данные в текстовый редактор и готовите их для следующих операций.
  • Написание кода с большим количеством одинаковых конструкций.

Регулярные выражения вне фронтенда

Как было сказано в начале, регулярные выражения применяются во многих языках программирования, но это не значит, что они везде раскрываются одинаково. В зависимости от языка они могут, например, добавлять разные фичи и работать с разной скоростью.

Если разобраться с регулярными выражениями на примере JavaScript, то обращаться к ним в других языках программирования будет уже легче. Но изучать нюансы и стандарты внутри каждого языка точно придётся.

Выводы

Регулярные выражения — довольно мощный инструмент. Он отлично справляется с задачами, которые сложно решить с помощью нативных методов языка, упрощает работу с кодом и даже его написание. При этом нужно понимать, когда его использовать, чтобы работать быстрее и эффективнее.

Больше статей

  • HTML-шаблонизаторы
  • Что такое и зачем нужны алгоритмы
  • Что такое CMS и как под них верстать

«Доктайп» — журнал о фронтенде. Читайте, слушайте и учитесь с нами.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *