Музыкальный сигнал одного инструмента содержит основную частоту и множество ее гармоник. Собственная / основная частота (fundamental frequency) — самая низкая частотная компонента сигнала. Считается, что на слух воспринимается до 10 гармоник, более высокие компоненты уже не слышны. Например, если основной тон имеет высоту 110Гц (ля большой октавы), то в сигнале, кроме основного тона, будут присутствовать его гармоники — 220Гц, 330Гц, 440Гц, и т.д. В этом легко убедится с помощью пианино. Достаточно плавно нажать клавишу ноты так, чтобы демпфер отошел от струны, а молоточек по струне не ударил. После этого сильно ударить и отпустить ноту октавой ниже. В результате, нижняя нота замолкнет, а верхняя из-за резонанса с гармоникой начнет играть.
Основной тон или высота звука (pitch) — слуховое восприятие частоты. Восприятие основного тона изменяется в зависимости от гармонических составляющих, присутствующих в сигнале. Возможно восприятие отсутствующего тона за счет наличия гармонических составляющих, обычно сопутствующих этому тону. Если акустическая система не в состоянии воспроизводить низкие частоты (например, при воспроизведении ля большой октавы, тон 110Гц не будет звучать), то все равно возможно восприятие этой частоты. Компания Waves Audio, производитель звуковых эффектов, запатентовала алгоритм (патент № 5,930,373), позволяющий создавать иллюзию наличия низких частот, синтезируя высшие гармоники по низкочастотному сигналу, и выпустила ряд устройств (MaxxBass), работающий по этому принципу.
В некоторых случаях при обработке звука (музыкального сигнала) требуется найти основной тон и его гармоники. Например, гитарный тюнер анализирует сигнал на лету и выдает погрешность настройки гитары, основываясь на измерениях основного тона.
Компания Antares Audio Technologies разработала систему Auto-Tune, которая позволяет анализировать голосовую партию и корректировать сигнал во время исполнения или записи. Эта система практически стала стандартом при записи вокала. Позже, эта же компания разработала технологию ATG-6, которая позволяет настраивать гитару прямо во время исполнения.
В программе Melodyne (компании Celemony Software GmbH) решается еще одна сложная задача — анализируется музыкальный сигнал, который может содержать несколько одновременно звучащих нот (аккорд) и соответственно содержать несколько основных тонов и их гармоник.
При решении подобных задач необходимо учитывать системы настройки музыкальных инструментов.
Музыкальный строй или темперация — система настройки музыкальных инструментов, которая задает частоты звучания нот. Есть разные способы настройки.
Натуральный звукоряд (scale) — ряд звуков (тонов), состоящий из основного тона и его гармонических обертонов. Каждый член такого ряда называется гармоникой. Некоторые музыкальные инструменты (горн, варган), в которых нет управляемых отверстий (вентилей), могут воспроизводить ноты только в пределах натурального звукоряда, что мешает их использованию совместно с другими инструментами.
На современных музыкальных инструментах (начиная с рояля) обычно используется равномерно темперированный строй. Преимущества равномерной темперации в том, что можно транспонировать пьесу на произвольный интервал вверх или вниз, но при этом гармоники некоторых тонов звучат выше или ниже других тонов (на 1-2Гц), создавая иногда слышимые биения.
Существуют и другие строи, которые позволяют решить проблемы биений, но при этом значительно усложняют конструкцию инструмента и способ игры на нем. Например, строй 53-х равных делений октавы (53-РТ), содержит 53 ноты в пределах одной октавы.
Showing posts with label обработка звука. Show all posts
Showing posts with label обработка звука. Show all posts
Цифровой аудиосигнал
Аудиосигнал — аналоговое или цифровое представление звука. Используется при записи, редактировании (обработке звука) и воспроизведении. Аудиосигнал не предназначен для передачи сообщений или событий. Также мы не будем рассматривать сжатый аудиосигнал, так как он не пригоден к цифровой обработке.
Среднее значение аналогового сигнала должно быть близко к 0В. Иначе постоянная составляющая будет вызывать затраты мощности без полезного действия. Часто усилители или активные колонки имеют защиту, которые выключают оборудование при появлении постоянной составляющей.
Дискретизация (sampling) — преобразование непрерывного аналогового сигнала в дискретный сигнал, производится Аналого-Цифровым Преобразователем (АЦП).
Перед дискретизацией сигнал транслируется в диапазон АЦП (например: от 0 до 5В). При трансляции нельзя допустить выход сигнала за диапазон АЦП, иначе возникнут неустранимые искажения — обрезание (clipping) сигнала.
Например, аналоговый сигнал, поступающий на АЦП, имеет диапазон от −1.5В до +1.5В. После трансляции получаем сигнал в диапазоне от 0.25 до 4.75В, который не выходит за рамки диапазона АЦП.
После дискретизации получаем цифровой сигнал, дискретные значения которого кодируются двоичным (прямым) кодом в диапазоне от 0 до M−1.
M = 2m, M — число уровней квантования, m — число разрядов.
Отсчет (sample) — одно значение дискретного сигнала. Цифровой сигнал является последовательностью отсчетов заданной разрядности, полученных с заданной частотой дискретизации.
Для цифровой обработки сигнал, полученный с АЦП, необходимо преобразовать в вещественное представление, чтобы оперировать теми же значениями, что и в аналоговом сигнале (в нашем примере: от −1.5 до 1.5).
Вещественные числа (real numbers) представляют в цифровом устройстве с помощью форматов с фиксированной или плавающей запятой.
Фиксированная запятая (fixed-point) — формат представления вещественного числа в памяти цифрового устройства в виде целого числа (integer). Основное преимущество такого представления то, что с такими числами можно производить арифметические операции, как с обычными целыми числами, но при этом нужно следить за порядком результата и не допускать переполнения.
Плавающая запятая (float-point) — форма представления действительных чисел, в которой число хранится в форме мантиссы и показателя степени (порядка). Для реализации формата чисел с плавающей запятой требуется аппаратная поддержка процессора.
Параметры цифрового аудиосигнала
Разрядность цифрового сигнала (bits resolution) — количество уровней квантования дискретного сигнала. В профессиональной аудио обработке применяется разрядность 16, 20 и 24 бит.
Частота дискретизации (sampling rate) — частота, с которой аналоговый сигнал дискретизируется в дискретный сигнал. В профессиональной аудио обработке применяются частоты дискретизации 44100Гц или 48000Гц. Также используются частоты в 2 или 4 раза выше — 88200/96000 или 176400/192000.
Формат представления — целые (прямой код) или вещественные (фиксированная или плавающая точка) числа.
Количество каналов — сигнал может быть моно, стерео и многоканальный (3..8 каналов). В некоторых случаях аудио обработка должна учитывать количество каналов.
Также цифровой сигнал характеризуется общими с аналоговым сигналом параметрами — мощность сигнала, частотный диапазон (frequency range), динамический диапазон (dynamic range).
Сглаживающий фильтр
Применяется для усреднения или сглаживания входного сигнала. При обработке звука используется для устранения скачков при изменении управляющих сигналов. Например, при повороте цифровой ручки громкости, значение усиления изменяется скачкообразно, что приводит к щелчкам/треску в записи. Для устранения такого дефекта достаточно сгладить управляющий сигнал.
Разностное уравнения, описывающее сглаживающий преобразователь:
y(n)=(1−α)∙x(n)+α∙y(n−1), 0<α<1
Для вычисления этого преобразователя необходимо сохранять значение выходного сигнала с предыдущего шага вычисления.
Есть два подхода к выбору коэффициента α. Первый — рассматривать преобразователь, как низкочастотный фильтр. Коэффициент α выбирается исходя из частоты дискретизации Fs (скорость поступления входных отсчетов) и от желаемой частоты среза Fc, где мощность сигнала (квадрат значений сигнала) ослабится в два раза.
Ослабление мощности сигнала в два раза по логарифмической шкале составит 10∙log(0.5)=−3Дб, а значения самого сигнала уменьшатся на 20∙log(0.5)=−6Дб по логарифмической шкале.
Например, задаем частоту дискретизации 44100Гц и частоту среза 50Гц. По формуле вычисляем коэффициенты
Разностное уравнения, описывающее сглаживающий фильтр с заданными параметрами:
Получим импульсную характеристику, подав единичный отсчет на преобразователь. Задаем количество отсчетов — 1024, обнуляем все входные отсчеты кроме первого и получаем отклик системы, состоящий из 1024 отсчетов.
Отображаем частоты в диапазоне от 0 до 4∙Fc. На нулевой частоте амплитуда единица, что означает отсутствие ослабления на низких частотах. На частоте 50Гц ослабление −3Дб
Второй подход рассматривать преобразователь во временной области. Постоянная времени (time constant) – это время, за которое переходная функция достигнет 63% от конечного значения. Постоянная времени связана
с частотой среза:
с частотой среза:
Рассчитаем постоянную времени для нашего примера. По формуле получается — 0.00318 сек. Получим переходную характеристику, подав все единицы на преобразователь. Задаем количество отсчетов — 1024, все входные отсчеты устанавливаем в единицу и получаем отклик системы, состоящий из 1024 отсчетов.
Рекомендованная литература
Компрессия аудио-сигнала
Пойдет речь не о сжатии информации, с целью экономии места на диске или в интернете, а о компрессии динамического диапазона при обработке звука. Звуковой эффект —компрессор, применяют при звукозаписи, озвучивании концертов или вещании. Компрессор (compressor) делает более тихие звуки громкими, уменьшая разницу между громкими и тихими звуками, и тем самым компрессирует динамический диапазон. Правильно настроенный компрессор позволяет устранять всплески громкости (например, удары барабана), неравномерность записи (если вокалист двигает микрофон или басист неравномерно извлекает звук), добавляет продолжительность в звук соло-гитары (sustain) и в целом может сделать звук более громким.
Для понимания работы компрессора рассмотрим пример его динамической характеристики. По горизонтальной оси отложены уровни входного сигнала, а по вертикальной — выходного. Если входной сигнал находится в пределах от −100дБ до −60дБ, то выходной сигнал глушится до −100дБ. Такая обработка позволяет не пропускать сигнал ниже определенного уровня и применяется для подавления шума (noise gate).
Следующий отрезок (−60дБ и −20дБ) наклонен под 45 градусов и означает линейную обработку, а именно входной сигнал будет усиливаться на 15дБ.
Если входной сигнал попадает в рамки от −20дБ до 0дБ, то он будем сжиматься в диапазон от −5дБ до 0дБ. Разница между диапазонами 20 к 5 определяет соотношение компрессии 4:1. Динамическую характеристику принято описывать следующими параметрами:
•Noise gate (уровень шума) — определяет уровень, ниже которого сигнал не проходит (обрезается).
•Threshold (пороговый уровень) — задает граничный уровень между линейным участком и началом компрессии.
•Ratio (соотношение между входным диапазоном и выходным) — задает степень компрессии. Если входной динамический диапазон меньше выходного, то происходит расширение динамического диапазона и компрессор становится экспандером (expander)
•Makeup gain — уровень громкости. После компрессии уровень сигнала становится меньше исходного и выходным уровнем громкости можно «восстановить справедливость». В случае расширения диапазона уровень сигнала повысится, и громкость нужно будет понизить.
В рассмотренном выше примере использовались такие значения параметров: Gate −60, Threshold −20, Ratio 4:1, Makeup 15.
Цифровые компрессоры позволяют практически произвольно редактировать динамическую характеристику, что дает большую свободу при использовании.
Рассмотрим схему работы компрессора. Входной динамический диапазон сигнала рассчитывается по средней мощности входного сигнала (Vrms) или по пиковым значениям (Vpeak). В некоторых компрессорах есть выбор между этими двумя опциями. Детектор уровня (на схеме Level detection) формирует управляющий сигнал, который управляет ослаблением (Gain Reduction Device) основного аудио-потока. Вместо входного сигнала (на схеме Audio Input) можно использовать сигнал с другого трека или устройства (External Input), например функция удаления свистящих согласных (De-Esser), реализуется с помощью этой возможности — на дополнительный вход подается фильтрованный сигнал (фильтр выделяет свистящий сигнал), который управляет ослаблением. Подобная схема применяется и при наложении голоса DJ-ея на музыку (Ducking). Голосовой сигнал подается на внешний канал, который управляет ослаблением.
Кроме динамической характеристики компрессоры позволяют управлять временем срабатывания механизма ослабления звука.
•Attack (время атаки) — время, которое проходит между превышением порогового значения и началом ослабления сигнала.
•Release (время спада) — время, которое проходит между тем, как уровень входного сигнала стал ниже порога, и моментом, когда компрессор перестает ослаблять сигнал.
Некоторые компрессоры позволяют рассчитывать ослабление с упреждением (look-ahead). При этом основной сигнал задерживается на время упреждения. Такая техника позволяет недопустить превышение порогового значения и сделать компрессию более мягкой.
Компрессор может применяться при многоканальной обработке (стерео или больше каналов). В этом случае применяются различные схемы управления ослаблением. Управляющий сигнал может формироваться в каждом канале отдельно (что может привести к некоторому рассогласованию каналов) или предварительно усредняться по всем каналам и только после этого поступать на схему детектирования уровня.
Рассмотрим схему работы компрессора. Входной динамический диапазон сигнала рассчитывается по средней мощности входного сигнала (Vrms) или по пиковым значениям (Vpeak). В некоторых компрессорах есть выбор между этими двумя опциями. Детектор уровня (на схеме Level detection) формирует управляющий сигнал, который управляет ослаблением (Gain Reduction Device) основного аудио-потока. Вместо входного сигнала (на схеме Audio Input) можно использовать сигнал с другого трека или устройства (External Input), например функция удаления свистящих согласных (De-Esser), реализуется с помощью этой возможности — на дополнительный вход подается фильтрованный сигнал (фильтр выделяет свистящий сигнал), который управляет ослаблением. Подобная схема применяется и при наложении голоса DJ-ея на музыку (Ducking). Голосовой сигнал подается на внешний канал, который управляет ослаблением.
Кроме динамической характеристики компрессоры позволяют управлять временем срабатывания механизма ослабления звука.
•Release (время спада) — время, которое проходит между тем, как уровень входного сигнала стал ниже порога, и моментом, когда компрессор перестает ослаблять сигнал.
Некоторые компрессоры позволяют рассчитывать ослабление с упреждением (look-ahead). При этом основной сигнал задерживается на время упреждения. Такая техника позволяет недопустить превышение порогового значения и сделать компрессию более мягкой.
Компрессор может применяться при многоканальной обработке (стерео или больше каналов). В этом случае применяются различные схемы управления ослаблением. Управляющий сигнал может формироваться в каждом канале отдельно (что может привести к некоторому рассогласованию каналов) или предварительно усредняться по всем каналам и только после этого поступать на схему детектирования уровня.
В случае использования компрессора при мастеринге можно совмещать компрессию динамического диапазона с квантованием/дизерингом. При квантовании (например, когда из 24-битной записи получают 16-битную) происходит сужение динамического диапазона и некоторые плагины позволяют совмещать две эти операции, что приводит к уменьшению общего уровня шума.
При мастеринге также применяют многополосные (multi-band) компрессоры. Весь частотный диапазон разбивается на поддиапазоны (обычно 3 или 4) и параметры компрессии в каждом диапазоне устанавливаются свои. Это позволяет, например, отделить мощные удары барабана, которые при общей компрессии могут привести к ослаблению вокала и других инструментов. Для разделения частот используют IIR или FIR фильтры. Фильтры IIR практически не вносят задержку в сигнал, но при этом возможны фазовые искажения. Фильтры FIR (с линейной фазовой характеристикой) задерживают сигнал на фиксированное время и рекомендуются для мастеринговых работ, где задержка сигнала не имеет принципиального значения.
При мастеринге также применяют многополосные (multi-band) компрессоры. Весь частотный диапазон разбивается на поддиапазоны (обычно 3 или 4) и параметры компрессии в каждом диапазоне устанавливаются свои. Это позволяет, например, отделить мощные удары барабана, которые при общей компрессии могут привести к ослаблению вокала и других инструментов. Для разделения частот используют IIR или FIR фильтры. Фильтры IIR практически не вносят задержку в сигнал, но при этом возможны фазовые искажения. Фильтры FIR (с линейной фазовой характеристикой) задерживают сигнал на фиксированное время и рекомендуются для мастеринговых работ, где задержка сигнала не имеет принципиального значения.
Рекомендованная литература:
Цифровой звук. Начало.
Цифровой звук. Начало.
Subscribe to:
Posts (Atom)











