Sed linux удалить последний символ в строке

Обновлено: 01.07.2024

Оригинал: Learning Linux Commands: sed
Автор: Rares Aioanei
Дата публикации: 19 ноября 2011 года
Перевод: А. Кривошей
Дата перевода: июль 2012 г.

Николай Игнатушко проверил на GNU sed version 4.2.1 в дистрибутиве Gentoo все команды, упомянутые в этой статье. Не все скрипты хорошо отрабатывали на версии GNU sed. Но дело касалось мелочей, которые исправлены. Только скрипт по замене hill на mountains пришлось существенно переделать.

1. Введение

2. Установка

Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:

В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.

3. Концепции

Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.

4. Регулярные выражения

По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:

Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо использовать команду sed 's/Nick|nick/John/g'. Вертикальная черта имеет значение, которое вы должны знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы, широко использующиеся в регулярных выражениях - это "?", который соответствует повторению предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour), "*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.

Команда sed - это потоковый редактор текста, работающий по принципу замены. Его можно использовать для поиска, вставки, замены и удаления фрагментов в файле. С помощью этой утилиты вы можете редактировать файлы не открывая их. Будет намного быстрее если вы напишите что и на что надо заменить, чем вы будете открывать редактор vi, искать нужную строку и вручную всё заменять.

В этой статье мы рассмотрим основы использования команды sed linux, её синтаксис, а также синтаксис регулярных выражений, который используется непосредственно для поиска и замены в файлах.

Команда sed в Linux

Сначала рассмотрим синтаксис команды:

$ sed опции -e команды файл

А вот её основные опции:

  • -n, --quiet - не выводить содержимое буфера шаблона в конце каждой итерации;
  • -e - команды, которые надо выполнить для редактирования;
  • -f - прочитать команды редактирования из файла;
  • -i - сделать резервную копию файла перед редактированием;
  • -l - указать свою длину строки;
  • -r - включить поддержку расширенного синтаксиса регулярных выражений;
  • -s - если передано несколько файлов, рассматривать их как отдельные потоки, а не как один длинный.

Я понимаю, что сейчас всё очень сложно, но к концу статьи всё прояснится.

1. Как работает sed

Теперь нужно понять как работает команда sed. У утилиты есть два буфера, это активный буфер шаблона и дополнительный буфер. Оба изначально пусты. Программа выполняет заданные условия для каждой строки в переданном ей файле.

sed читает одну строку, удаляет из неё все завершающие символы и символы новой строки и помещает её в буфер шаблона. Затем выполняются переданные в параметрах команды, с каждой командой может быть связан адрес, это своего рода условие и команда выполняется только если подходит условие.

Когда всё команды будут выполнены и не указана опция -n, содержимое буфера шаблона выводится в стандартный поток вывода перед этим добавляется обратно символ перевода строки. если он был удален. Затем запускается новая итерация цикла для следующей строки.

Если не используются специальные команды, например, D, то после завершения одной итерации цикла содержимое буфера шаблона удаляется. Однако содержимое предыдущей строки хранится в дополнительном буфере и его можно использовать.

2. Адреса sed

Каждой команде можно передать адрес, который будет указывать на строки, для которых она будет выполнена:

  • номер - позволяет указать номер строки, в которой надо выполнять команду;
  • первая

Если для команды не был задан адрес, то она будет выполнена для всех строк. Если передан один адрес, команда будет выполнена только для строки по этому адресу. Также можно передать диапазон адресов. Тогда адреса разделяются запятой и команда будет выполнена для всех адресов диапазона.

3. Синтаксис регулярных выражений

Вы можете использовать такие же регулярные выражения, как и для Bash и популярных языков программирования. Вот основные операторы, которые поддерживают регулярные выражения sed Linux:

  • * - любой символ, любое количество;
  • \+ - как звездочка, только один символ или больше;
  • \? - нет или один символ;
  • \ - любой символ в количестве i;
  • \ - любой символ в количестве от i до j;
  • \ - любой символ в количестве от i и больше.

4. Команды sed

Если вы хотите пользоваться sed, вам нужно знать команды редактирования. Рассмотрим самые часто применяемые из них:

Утилите можно передать несколько команд, для этого их надо разделить точкой с запятой или использовать две опции -e. Теперь вы знаете всё необходимое и можно переходить к примерам.

Примеры использования sed

Теперь рассмотрим примеры sed Linux, чтобы у вас сложилась целостная картина об этой утилите. Давайте сначала выведем из файла строки с пятой по десятую. Для этого воспользуемся командой -p. Мы используем опцию -n чтобы не выводить содержимое буфера шаблона на каждой итерации, а выводим только то, что нам надо. Если команда одна, то опцию -e можно опустить и писать без неё:

sed -n '5,10p' /etc/group

Или можно вывести весь файл, кроме строк с первой по двадцатую:

sed '1,20d' /etc/group

Здесь наоборот, опцию -n не указываем, чтобы выводилось всё, а с помощью команды d очищаем ненужное. Дальше рассмотрим замену в sed. Это самая частая функция, которая применяется вместе с этой утилитой. Заменим вхождения слова root на losst в том же файле и выведем всё в стандартный вывод:

sed 's/root/losst/g' /etc/group

Флаг g заменяет все вхождения, также можно использовать флаг i, чтобы сделать регулярное выражение sed не зависимым от регистра. Для команд можно задавать адреса. Например, давайте выполним замену 0 на 1000, но только в строках с первой по десятую:

sed '1,10 s/0/1000/g' /etc/group

Переходим ещё ближе к регулярным выражениям, удалим все пустые строки или строки с комментариями из конфига Apache:

sed 's/[$p*]/losst_p/g' /etc/group

Если вам надо записать результат замены в обратно в файл можно использовать стандартный оператор перенаправления вывода > или утилиту tee. Например:

Также можно использовать опцию -i, тогда утилита не будет выполнять изменения в переданном ей файле:

Если надо сохранить оригинальный файл, достаточно передать опции -i в параметре расширение для файла резервной копии.

Выводы

Из этой статьи вы узнали что представляет из себя команда sed Linux. Как видите, это очень гибкий инструмент, который позволяет делать с текстом очень многое. Он сложный в освоении, но с помощью него очень удобно решать многие задачи редактирования конфигурационных файлов или фильтрации вывода.

Нет похожих записей


Статья распространяется под лицензией Creative Commons ShareAlike 4.0 при копировании материала ссылка на источник обязательна.

Оцените статью:

(14 оценок, среднее: 2,64 из 5)

Об авторе

11 комментариев

Да. Было время, когда и я тоже пользовался sed-ом. Причём несколько раз.
Но потом понял -- мне проще и быстрее выполнять редактирование текста в обычном редакторе.

Если работа происходит в графической консоли (у меня Debian, MATE), то проще запустить текстовый редактор pluma. Если же нужно выполнить редактирование удалённого файла (в смысле на другом компе), то это проще сделать с помощью nano или mcedit (из пакета mc). На крайняк скопировать удалённый файл к себе на комп, изменить и вернуть обратно. Но использовать sed-ом -- 🙁 . смысл этого я что-то не очень понимаю. На минутчку! За последние лет 10 я его так ни разу по делу и не использовал, не было нужды прибегать именно к нему на фоне других редакторов текста.

А никто случаем не заметил диссонанса на скриншотах в статье? С одной стороны -- мощный компьютер с мощным процессором и гигабайтами памяти, современной видеокартой с высоким разрешением и графический рабочий стол. А с другой -- какой-то маленький потоковый редактор, которому для его работы нужно совсем ничтожное количество ресурсов компа. Которому совсем не нужна графика рабочего стола. Который, чтобы правильно запустить в работу и получить результат, которому можно верить, -- нужно ещё вспомнить как это всё делается. Что мы делаем? Какой в этом смысл?

Да, sed -- очень симпатичный и быстрый редактор. Я искренне извиняюсь, но я просто не вижу ему реальных применение. Разве что понастальгировать. Но это из области эмоций, а не технологий. Мир Линукса изменился сильно со времен, когда sed был актуален. Изменились инструменты. Изменился подход к решению задач.

sed - инструмент программиста, наиболее частая область применения - скрипты, используется обычно для автоматизации сложных деплойментов, предполагающих много рутины, чтобы ручками нужные файлы не редактировать, вся рутина выстраивается в сценарий, а потом скрипт просто исполняется на сервере. Желающие использовать его в командной строке, ну чо, пусть поупражняются, всё одно - польза и интеллектуальное развитие организма.

Спасибо!
Несколько далёк от этой области. Тоже программер, но пишу под микроконтроллеры и немного для компов (десктоп-программулины). Админка и вэб -- не моё. Не знал, что там есть применение sed-у.

Занят в embedded разработке под arm, phytec и т.п. Частенько приходилось в загрузочных скриптах или сервисных скриптах задействовать sed для автоматического парсинга логов, конфигурационных параметров системы и т.п. Утилиту sed очень удобно применять, когда входные данные на лету требуется преобразовать к требуемому для последующей переработки виду. Где кроется гемор с регулярными выражениями, так это в случаях, когда требуется автоматическое сервисное обслуживание устройств в сети по ssh. При необходимости передачи вложенных скриптовых выражений, которые частично должны интерпретироваться как чистый текст с необходимостью использования символов экранирования, а частично как команды подстановки. У меня бывали случаи, когда использование одного экранирующего символа "\" в исходном выражении могло приводить к преобразованию его к "\\\" для передачи выражения по ssh, в отдельных случаях неявное поведение баша вообще не позволяло сделать корректное эквивалентное преобразование команд для передачи по ssh. Честно говоря, регулярные выражения мне нравятся ровно до тех пор, пока из них не требуется сформировать более менее сложную команду. Это чуть ли не единственная для шелла вещь из области "Использовал при написании в скрипте, а потом через пол-года не можешь вспомнить, что эта мешанина из спец. и экранирующих символов может значить" XD

Ага. И Вам тоже спасибо!
Я задам, возможно, глупый вопрос -- а файлы, о которых Вы говорите -- загрузочные скрипты, логи и так далее -- они какие по размеру? Сколько строк или килобайт в среднем? Я просто не очень себе представляю.

Ну и мой глупый вопрос -- а почему с этими файлами лучше работать с помощью sed, а не обрабатывать их в Perl или Python?

Я совершенно не представляю специфики, поэтому могу спросить что-то не то. Извиняйте, если что.

Ещё один пример, есть резервная копия базы данных размером в 1 Гб, надо заменить все запросы INSERT на INSERT IGNORE.

Сегодня пришлось заняться: пользователь удалил несколько писем из архива за 2019 год почты Mozilla Thunderbird. Их надо восстановить. В "Удаленные" это письма, почему-то, не попали. Фактически письма всё ещё находятся в файле 2019 размером 9 Гб.
Задача: заменить все строки X-Mozilla-Status: 0009 на X-Mozilla-Status: 0001. mcedit даже на открытии такого файла уже "присел".
И вот решение: sed -i 's/X-Mozilla-Status:\ 0009/X-Mozilla-Status:\ 00091/g' 2019. Пара минут и все удалённые письма восстановлены.

Извините, ошибся: sed -i 's/X-Mozilla-Status:\ 0009/X-Mozilla-Status:\ 0001/g' 2019

Удаление символов из строки в Bash

Иногда вам может потребоваться удалить символы из строки. Какой бы ни была причина, Linux предоставляет вам различные встроенные удобные инструменты, которые позволяют удалять символы из строки в Bash. В этой статье показано, как использовать эти инструменты для удаления символов из строки.

В статье рассказывается, как выполнить следующее:

  • Удалить символ из строки с помощью sed
  • Удалить символ из строки с помощью awk
  • Удалить символ из строки с помощью вырезания
  • Удалить символ из строки с помощью tr

Команды, показанные в этой статье, были выполнены в Ubuntu 20.04 Фокальная ямка. Те же команды можно выполнять и в других дистрибутивах Linux, в которых доступны указанные выше инструменты. Мы будем использовать приложение Терминала по умолчанию для запуска команд. Вы можете получить доступ к приложению Терминал с помощью сочетания клавиш Ctrl + Alt + T.

Удаление символов из строки с помощью sed

Sed - мощная и удобная утилита, используемая для редактирования потоков текста. Это неинтерактивный текстовый редактор, который позволяет выполнять базовые манипуляции с текстом над входными потоками. Вы также можете использовать sed для удаления нежелательных символов из строк.

В демонстрационных целях мы будем использовать образец строки, а затем передать ее команде sed.

Удалить определенный символ из строки

Используя sed, вы можете удалить определенный символ из строки. Например, чтобы удалить «h» из строки «Здравствуйте, как поживаете?”Команда будет такой:

$ echo "привет как дела?"| sed 's / h //'


Это удалит только первое вхождение 'h' в строке.

Чтобы удалить все вхождения 'h' из строки, используйте следующую команду:

$ echo "привет как дела?"| sed 's / h // g'


Где грамм означает глобальный. Он удалит все вхождения 'h' в строке.

Удалить первый символ из строки

Чтобы удалить первый символ из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| sed 's / ^.//' файл


Где (.) соответствует ровно одному символу, а (^) соответствует любому символу в начале строки.

Удалить последний символ из строки

Чтобы удалить последний символ из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| sed 's /.$ // '


Где (.) соответствует ровно одному символу, а ($) соответствует любому символу в конце строки.

Удалить первый и последний символы из строки

Чтобы удалить первый и последний символы из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| sed 's / ^.//; с /.$ // '


Удаление символов из строки с помощью awk

Awk - это мощный язык сценариев, используемый для сопоставления с образцом наряду с обработкой текста. AWK позволяет фильтровать и преобразовывать текст различными способами. Вы также можете использовать awk для удаления символов из строк.

В демонстрационных целях мы будем использовать образец строки, а затем передать ее команде awk.

Удалить первый символ из строки

Чтобы удалить первый символ из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| awk 'print substr ($ 0, 2)'


Где ($ 0) - это вся целевая строка, а (2) - начальная позиция символа. Вышеупомянутая команда удаляет первый символ «h», номер символа «1» и возвращает целевую строку, начинающуюся со второго символа, «e».'

Удалить первые два символа из строки

Вы также можете удалить определенное количество символов из начала строки. Например, чтобы удалить первые два символа из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| awk 'print substr ($ 0, 3)'


Вышеупомянутая команда удалит первые два символа, «он» или номера символов «1 и 2», и вернет целевую строку, начинающуюся с символа «3» или «l».'

Удалить последний символ из строки

Чтобы удалить последний символ из «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| awk 'print substr ($ 0, 1, длина ($ 0) -1)'

Где длина ($ 0) -1 означает вычитание '1'от общей длины символа.

Приведенная выше команда напечатает строку, начинающуюся с номера символа '1' вплоть до длина ($ 0) -1 убрать последний символ.

Есть '19'символы (включая пробелы) в приведенной выше строке. Команда будет работать, печатая все символы, начиная с символа '1'и до персонажа'18,'при удалении последнего символа'19.'


Удалить последние два символа из строки

Чтобы удалить последние два символа из "Здравствуйте, как поживаете?”Команда будет такой:

$ echo "привет как дела?"| awk 'print substr ($ 0, 1, длина ($ 0) -2)'

Где длина ($ 0) -2 означает вычитание '2'от общей длины символа.


Приведенная выше команда напечатает строку, начинающуюся с номера символа '1'и до номера символа'длина ($ 0) -2,'чтобы удалить последние два символа в строке.

Удалить как первый, так и последний символы из строки

Чтобы удалить как первый, так и последний символы из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| awk 'print substr ($ 0, 2, длина ($ 0) - 2)'

Где длина ($ 0) -2 означает вычитание '2'от общей длины символа.

Приведенная выше команда напечатает строку, начинающуюся с номера символа '2'до номера символа'длина ($ 0) -2,'чтобы удалить первый и последний символ.


Удалить символ из строки с помощью вырезания

Вырезать - это инструмент командной строки, обычно используемый для извлечения части текста из строки или файла и вывода результата на стандартный вывод. Вы также можете использовать эту команду для удаления символов из строки.

В демонстрационных целях мы будем использовать образец строки, а затем передать ее команде вырезания.

Удалить первый символ из строки

Чтобы удалить первый символ из строки, «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| cut -c 2-


Эта команда напечатает строку, начиная со второго символа, удаляя первый символ.

Удалить первые четыре символа из строки

Чтобы удалить первые четыре символа из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| cut -c 5-


Эта команда напечатает строку, начиная с пятого символа, удаляя первые четыре символа.

Печатать строку между 2-м и 5-м символами

Чтобы напечатать строку «Здравствуйте, как поживаете?” между вторым и пятым персонажами, команда будет такой:

$ echo "привет как дела?"| cut -c 2-5


Эта команда напечатает строку, начиная со второго символа и до пятого символа, удаляя оставшиеся начальный и конечный символы.

Удалить последний символ из строки

Чтобы удалить последний символ из строки «Здравствуйте, как поживаете?” использовать резать команда с rev, следующим образом:

$ echo "привет как дела?"| rev | cut -c2- | rev


Эта команда работает, сначала перевернув строку, затем вырезая первый символ и, наконец, снова перевернув ее, чтобы получить желаемый результат.

Удалить последние четыре символа из строки

Чтобы удалить последние четыре символа из строки «Здравствуйте, как поживаете?” команда будет такой:

$ echo "привет как дела?"| rev | cut -c5- | rev


Эта команда работает, сначала перевернув строку, затем вырезая первые четыре символа, а затем снова перевернув ее, чтобы получить желаемый результат.

Удалить первый и последний символы из строки

Чтобы удалить первый и последний символы из строки «Здравствуйте, как поживаете?” использовать резать команда с rev, следующим образом:

$ echo "привет, мир!"| cut -c2- | rev | cut -c2- | rev


Эта команда работает, вырезая первый символ, затем переворачивая строку и вырезая ее первый символ, а затем снова меняя ее, чтобы получить желаемый результат.

Удалить символ из строки с помощью tr

Команда tr (сокращение от translate) используется для перевода, сжатия и удаления символов из строки. Вы также можете использовать tr для удаления символов из строки.

В демонстрационных целях мы будем использовать образец строки, а затем передать ее команде tr.

Удалить все вхождения символа

Используя команду tr, вы можете удалить все вхождения строчных или прописных символов из вашей строки. Например, чтобы удалить все вхождения строчного символа «h» из строки, команда будет выглядеть так:

$ echo "Привет, как дела?"| tr -d h


Точно так же, чтобы удалить все вхождения символа верхнего регистра «H» из строки, команда будет выглядеть так:

$ echo "Привет, как дела?"| tr -d H

Вы также можете использовать интерпретируемые последовательности для удаления строчных или прописных букв:

$ echo "Привет, как дела?"| tr -d [: upper:]


$ echo "ПРИВЕТ! Как дела??"| tr -d [: нижний:]


Удалить все вхождения строчных и прописных символов

Вы также можете удалить все вхождения как строчных, так и прописных символов из строки. Например, следующая команда удалит все вхождения символа 'h' как в нижнем, так и в верхнем регистре.

$ echo "Привет, как дела?"| tr -d 'hH'


Удалить все вхождения символов в определенном диапазоне

Чтобы удалить все вхождения символов из строки в определенном диапазоне 'd-h', команда будет выглядеть так:

$ echo "привет как дела?"| tr -d 'd-h'


Эта команда удалит все символы в диапазоне 'd-h' (d, e, f, g, h) в строке.

Заключение

В Linux всегда будет несколько способов выполнить простую работу. То же самое и с удалением символов из строки. В этой статье было показано четыре различных способа сделать это, а также несколько примеров удаления нежелательных символов из строки. Решение о том, какой инструмент использовать, зависит от ваших предпочтений и, что более важно, от того, чего вы хотите достичь.

Генерация ключей SSH в Linux

ssh

В прошлый раз мы говорили о функциях в bash-скриптах, в частности, о том, как вызывать их из командной строки. Наша сегодняшняя тема — весьма полезный инструмент для обработки строковых данных — утилита Linux, которая называется sed. Её часто используют для работы с текстами, имеющими вид лог-файлов, конфигурационных и других файлов.




Если вы, в bash-скриптах, каким-то образом обрабатываете данные, вам не помешает знакомство с инструментами sed и gawk. Тут мы сосредоточимся на sed и на работе с текстами, так как это — очень важный шаг в нашем путешествии по бескрайним просторам разработки bash-скриптов.


Сейчас мы разберём основы работы с sed, а так же рассмотрим более трёх десятков примеров использования этого инструмента.

Основы работы с sed

Утилиту sed называют потоковым текстовым редактором. В интерактивных текстовых редакторах, наподобие nano, с текстами работают, используя клавиатуру, редактируя файлы, добавляя, удаляя или изменяя тексты. Sed позволяет редактировать потоки данных, основываясь на заданных разработчиком наборах правил. Вот как выглядит схема вызова этой команды:


По умолчанию sed применяет указанные при вызове правила, выраженные в виде набора команд, к STDIN . Это позволяет передавать данные непосредственно sed.


Вот что получится при выполнении этой команды.


Простой пример вызова sed

В данном случае sed заменяет слово «test» в строке, переданной для обработки, словами «another test». Для оформления правила обработки текста, заключённого в кавычки, используются прямые слэши. В нашем случае применена команда вида s/pattern1/pattern2/ . Буква «s» — это сокращение слова «substitute», то есть — перед нами команда замены. Sed, выполняя эту команду, просмотрит переданный текст и заменит найденные в нём фрагменты (о том — какие именно, поговорим ниже), соответствующие pattern1 , на pattern2 .

Выше приведён примитивный пример использования sed, нужный для того, чтобы ввести вас в курс дела. На самом деле, sed можно применять в гораздо более сложных сценариях обработки текстов, например — для работы с файлами.

Ниже показан файл, в котором содержится фрагмент текста, и результаты его обработки такой командой:


Текстовый файл и результаты его обработки

Здесь применён тот же подход, который мы использовали выше, но теперь sed обрабатывает текст, хранящийся в файле. При этом, если файл достаточно велик, можно заметить, что sed обрабатывает данные порциями и выводит то, что обработано, на экран, не дожидаясь обработки всего файла.

Выполнение наборов команд при вызове sed

Для выполнения нескольких действий с данными, используйте ключ -e при вызове sed. Например, вот как организовать замену двух фрагментов текста:


Использование ключа -e при вызове sed

К каждой строке текста из файла применяются обе команды. Их нужно разделить точкой с запятой, при этом между окончанием команды и точкой с запятой не должно быть пробела.
Для ввода нескольких шаблонов обработки текста при вызове sed, можно, после ввода первой одиночной кавычки, нажать Enter, после чего вводить каждое правило с новой строки, не забыв о закрывающей кавычке:


Вот что получится после того, как команда, представленная в таком виде, будет выполнена.


Другой способ работы с sed

Чтение команд из файла

Если имеется множество команд sed, с помощью которых надо обработать текст, обычно удобнее всего предварительно записать их в файл. Для того, чтобы указать sed файл, содержащий команды, используют ключ -f :

Вот содержимое файла mycommands :


Вызовем sed, передав редактору файл с командами и файл для обработки:


Результат при вызове такой команды аналогичен тому, который получался в предыдущих примерах.


Использование файла с командами при вызове sed

Флаги команды замены

Внимательно посмотрите на следующий пример.


Вот что содержится в файле, и что будет получено после его обработки sed.


Исходный файл и результаты его обработки

Команда замены нормально обрабатывает файл, состоящий из нескольких строк, но заменяются только первые вхождения искомого фрагмента текста в каждой строке. Для того, чтобы заменить все вхождения шаблона, нужно использовать соответствующий флаг.

Схема записи команды замены при использовании флагов выглядит так:


Выполнение этой команды можно модифицировать несколькими способами.

  • При передаче номера учитывается порядковый номер вхождения шаблона в строку, заменено будет именно это вхождение.
  • Флаг g указывает на то, что нужно обработать все вхождения шаблона, имеющиеся в строке.
  • Флаг p указывает на то, что нужно вывести содержимое исходной строки.
  • Флаг вида w file указывает команде на то, что нужно записать результаты обработки текста в файл.


Вызов команды замены с указанием позиции заменяемого фрагмента

Тут мы указали, в качестве флага замены, число 2. Это привело к тому, что было заменено лишь второе вхождение искомого шаблона в каждой строке. Теперь опробуем флаг глобальной замены — g :


Как видно из результатов вывода, такая команда заменила все вхождения шаблона в тексте.


Глобальная замена

Флаг команды замены p позволяет выводить строки, в которых найдены совпадения, при этом ключ -n , указанный при вызове sed, подавляет обычный вывод:


Как результат, при запуске sed в такой конфигурации на экран выводятся лишь строки (в нашем случае — одна строка), в которых найден заданный фрагмент текста.


Использование флага команды замены p

Воспользуемся флагом w , который позволяет сохранить результаты обработки текста в файл:


Сохранение результатов обработки текста в файл

Хорошо видно, что в ходе работы команды данные выводятся в STDOUT, при этом обработанные строки записываются в файл, имя которого указано после w .

Символы-разделители

Представьте, что нужно заменить /bin/bash на /bin/csh в файле /etc/passwd . Задача не такая уж и сложная:


Однако, выглядит всё это не очень-то хорошо. Всё дело в том, что так как прямые слэши используются в роли символов-разделителей, такие же символы в передаваемых sed строках приходится экранировать. В результате страдает читаемость команды.

К счастью, sed позволяет нам самостоятельно задавать символы-разделители для использования их в команде замены. Разделителем считается первый символ, который будет встречен после s :


В данном случае в качестве разделителя использован восклицательный знак, в результате код легче читать и он выглядит куда опрятнее, чем прежде.

Выбор фрагментов текста для обработки

До сих пор мы вызывали sed для обработки всего переданного редактору потока данных. В некоторых случаях с помощью sed надо обработать лишь какую-то часть текста — некую конкретную строку или группу строк. Для достижения такой цели можно воспользоваться двумя подходами:

  • Задать ограничение на номера обрабатываемых строк.
  • Указать фильтр, соответствующие которому строки нужно обработать.


Обработка только одной строки, номер который задан при вызове sed

Второй вариант — диапазон строк:


Обработка диапазона строк

Кроме того, можно вызвать команду замены так, чтобы файл был обработан начиная с некоей строки и до конца:


Обработка файла начиная со второй строки и до конца

Для того, чтобы обрабатывать с помощью команды замены только строки, соответствующие заданному фильтру, команду надо вызвать так:


По аналогии с тем, что было рассмотрено выше, шаблон передаётся перед именем команды s .


Обработка строк, соответствующих фильтру

Тут мы использовали очень простой фильтр. Для того, чтобы в полной мере раскрыть возможности данного подхода, можно воспользоваться регулярными выражениями. О них мы поговорим в одном из следующих материалов этой серии.

Удаление строк

Утилита sed годится не только для замены одних последовательностей символов в строках на другие. С её помощью, а именно, используя команду d , можно удалять строки из текстового потока.

Вызов команды выглядит так:


Мы хотим, чтобы из текста была удалена третья строка. Обратите внимание на то, что речь не идёт о файле. Файл останется неизменным, удаление отразится лишь на выводе, который сформирует sed.


Удаление третьей строки

Если при вызове команды d не указать номер удаляемой строки, удалены будут все строки потока.

Вот как применить команду d к диапазону строк:


Удаление диапазона строк

А вот как удалить строки, начиная с заданной — и до конца файла:


Удаление строк до конца файла

Строки можно удалять и по шаблону:


Удаление строк по шаблону

При вызове d можно указывать пару шаблонов — будут удалены строки, в которых встретится шаблон, и те строки, которые находятся между ними:


Удаление диапазона строк с использованием шаблонов

Вставка текста в поток

С помощью sed можно вставлять данные в текстовый поток, используя команды i и a :

  • Команда i добавляет новую строку перед заданной.
  • Команда a добавляет новую строку после заданной.


Теперь взглянем на команду a :


Как видно, эти команды добавляют текст до или после данных из потока. Что если надо добавить строку где-нибудь посередине?

Тут нам поможет указание номера опорной строки в потоке, или шаблона. Учтите, что адресация строк в виде диапазона тут не подойдёт. Вызовем команду i , указав номер строки, перед которой надо вставить новую строку:


Команда i с указанием номера опорной строки

Проделаем то же самое с командой a :


Команда a с указанием номера опорной строки

Обратите внимание на разницу в работе команд i и a . Первая вставляет новую строку до указанной, вторая — после.

Замена строк

Команда c позволяет изменить содержимое целой строки текста в потоке данных. При её вызове нужно указать номер строки, вместо которой в поток надо добавить новые данные:


Замена строки целиком

Если воспользоваться при вызове команды шаблоном в виде обычного текста или регулярного выражения, заменены будут все соответствующие шаблону строки:


Замена строк по шаблону

Замена символов

Команда y работает с отдельными символами, заменяя их в соответствии с переданными ей при вызове данными:


Замена символов

Используя эту команду, нужно учесть, что она применяется ко всему текстовому потоку, ограничить её конкретными вхождениями символов нельзя.

Вывод номеров строк

Если вызвать sed, использовав команду = , утилита выведет номера строк в потоке данных:


Вывод номеров строк

Потоковый редактор вывел номера строк перед их содержимым.

Если передать этой команде шаблон и воспользоваться ключом sed -n , выведены будут только номера строк, соответствующих шаблону:


Вывод номеров строк, соответствующих шаблону

Чтение данных для вставки из файла

Выше мы рассматривали приёмы вставки данных в поток, указывая то, что надо вставить, прямо при вызове sed. В качестве источника данных можно воспользоваться и файлом. Для этого служит команда r , которая позволяет вставлять в поток данные из указанного файла. При её вызове можно указать номер строки, после которой надо вставить содержимое файла, или шаблон.


Вставка в поток содержимого файла

Тут содержимое файла newfile было вставлено после третьей строки файла myfile .

Вот что произойдёт, если применить при вызове команды r шаблон:


Использование шаблона при вызове команды r

Содержимое файла будет вставлено после каждой строки, соответствующей шаблону.

Пример

Представим себе такую задачу. Есть файл, в котором имеется некая последовательность символов, сама по себе бессмысленная, которую надо заменить на данные, взятые из другого файла. А именно, пусть это будет файл newfile , в котором роль указателя места заполнения играет последовательность символов DATA . Данные, которые нужно подставить вместо DATA , хранятся в файле data .

Решить эту задачу можно, воспользовавшись командами r и d потокового редактора sed:


Замена указателя места заполнения на реальные данные

Как видите, вместо заполнителя DATA sed добавил в выходной поток две строки из файла data .

Итоги

Сегодня мы рассмотрели основы работы с потоковым редактором sed. На самом деле, sed — это огромнейшая тема. Его изучение вполне можно сравнить с изучением нового языка программирования, однако, поняв основы, вы сможете освоить sed на любом необходимом вам уровне. В результате ваши возможности по обработке с его помощью текстов будет ограничивать лишь воображение.

На сегодня это всё. В следующий раз поговорим о языке обработки данных awk.


скажем, у меня есть произвольный многострочный текстовый файл:

Как я могу удалить только последний символ (e, а не новую строку или null) файла, не делая текстовый файл недействительным?

более простой подход (выводит в stdout, не обновляет входной файл):

  • $ - Это адрес Sed, который соответствует только последней строке ввода, что вызывает следующий вызов функции ( s/.$// ) для выполнения только в последней строке.
  • s/.$// заменяет последний символ на (в данном случае последние строка) с пустой строкой, т. е. эффективно удаляет последний символ. (перед новой строкой) на линия.
    . соответствует любому символу на линии, и после него с $ закрепляет матч до конца линии; обратите внимание, как использование $ в этой регулярные выражения концептуально связаны, но технически отличается от предыдущего использования $ как Sed адрес.

пример с вводом stdin (предполагает Bash, Ksh или Zsh):

до обновить входной файл тоже (не использовать, если входной файл является символической ссылкой):

Примечание:
* На OSX вам придется использовать -i '' вместо -i ; для обзора подводных камней, связанных с -i , смотрите нижнюю половину мой ответ здесь.
* Если вам нужно обработать очень большие входные файлы и/или производительность / использование диска являются проблемой и вы используете GNU утилиты (Linux), см. sorontar ответ.

truncate

удаляет один (-1) символ из конца того же файла. Точно как >> будет добавить в тот же файл.

проблема с этим подходом заключается в том, что он не сохраняет пустую строку, если она существует.

это работает, потому что хвост принимает последний байт (не char).

это почти не занимает времени даже с большими файлами.

почему не sed

проблема с решением sed, как sed '$ s/.$//' file это то, что он сначала читает весь файл (занимает много времени с большими файлами), затем вам нужен временный файл (того же размера, что и оригинал):

а затем переместите tempfile для замены файла.

вот еще одно использование ex , который я нахожу не таким загадочным, как решение sed:

на $ идет к последней строке, s удаляет последний символ, и wq является хорошо известным (для пользователей vi) write + quit.

после целого ряда игр с различными стратегиями (и избегая sed-i или perl), лучший способ, который я нашел, чтобы сделать это:

Если цель состоит в том, чтобы удалить последний символ в последней строке, это awk надо сделать:

Он хранит все данные в массив, затем распечатывает его и изменяет последнюю строку.

ОТРЕДАКТИРОВАННЫЙ ОТВЕТ

Я создал скрипт и поместил ваш текст на свой рабочий стол. этот тестовый файл сохраняется как "old_file.txt"

после этого я написал небольшой скрипт, чтобы взять старый файл и устранить последний символ в последней строке

открыв созданный мною файл new_file, показал вывод следующим образом:

прошу прощения за мой предыдущий ответ (не читал внимательно)

просто замечание: sed временно удалит файл. Поэтому, если вы отслеживаете файл, вы получите предупреждение "нет такого файла или каталога", пока не переиздадите команду tail.

Читайте также: