Компьютерные методы и цифровая обработка сигналов звука в фоноскопии
Прежде чем перейти к рассмотрению компьютерных средств анализа фонограмм, используемых в фоноскопии, необходимо кратко остановиться на основных отличиях аналоговых и цифровых звуковых сигналов.
Аналоговый сигнал - это изменение напряжения пропорционально изменениям состояния источника сигнала и изменениям окружающей среды. Слово «аналоговый» применительно к электрическому сигналу обозначает, что этот сигнал непрерывен по времени и амплитуде. Он точно отражает форму звуковой волны, которая распространяется в воздухе; и в этом случае аналоговый сигнал - это изменение напряжения, пропорциональное изменению звукового давления.
Непрерывный сигнал с математической точки зрения в общем виде - это любое действительное или комплексное колебание во времени fit), определяемое как некоторая функция непрерывной действительной временной переменной t. Непрерывные сигналы часто называют аналоговыми сигналами. Дискретный сигнал (discretus - лат. разделенный, прерывистый) - это‘произ- Вольная функция J[t], представляющая собой некоторую последовательность действительных или комплексных чисел, определенную при всех целочисленных значениях и. В научной литературе принято дискретную функцию обозначать в квадратных скобках, а аналоговую - в круглых.
Сигнал, который может принимать не любое, а только конечное число значений, называется цифровым сигналом. В рамках фоноскопической экспертизы при инструментальных исследованиях часто анализируется цифровой сигнал, т. е. сигнал, прошедший дискретизацию на аналогово-цифровом преобразователе.
Вообще говоря, термины «аналоговый» и «дискретный» принято относить к радиотехнике: если сигнал порожден физическим процессом, который можно описать непрерывной функцией, его называют аналоговым, имея в виду его соответствие реальному процессу. Дискретный сигнал, как правило, является Последовательностью импульсов, применяемых для кодирования чисел.
Чаще всего речь идет о двоичном представлении чисел. В этом случае единица представлена высоким, а нуль - низким потенциалом напряжения.То есть аналоговый сигнал представляет собой непрерывный во времени и по амплитуде процесс, а его цифровое представление есть Последовательность или ряд чисел, состоящих из конечного числа бит. Поэтому преобразование аналогового сигнала в цифровой состоит из: Дискретизации по времени и квантования по амплитуде.
Дискретизация по времени обычно означает, что сигнал представляется рядом своих отсчётов (дискретов), непрерывных По амплитуде и взятых через равные промежутки времени (хотя в Некоторых специальных случаях может применяться и неравномерная по времени дискретизация; например, при оцифровке узкополосных сигналов).
Кодирование аналогового сигнала в цифровую форму называется его оцифровкой и осуществляется специальным устройством - аналого-цифровым преобразователем (АЦП). Основное требование к таким устройствам - преобразовывать аналоговый сигнал в цифровой без искажений и с сохранением всех криминалистически значимых признаков речи и иной акустической информации, имеющейся на фонограмме.
Для вывода цифровых данных из компьютера и представления их в виде аналогового сигнала используют цифро- аналоговые преобразователи (ЦАП). Как правило, эти два устройства конструктивно смонтированы на одной плате (АЦП/ЦАП) и вставляются непосредственно в ПЭВМ.
Однако в высококачественных комплексах обработки речевого сигнала с низким уровнем собственных шумов и большим динамическим диапазоном устройства АЦП/ЦАП выполнены в виде отдельного модуля, изолированного от ПЭВМ. Необходимость применения таких устройств вызвана тем, что вычислительная техника воспринимает любой символ или процесс как совокупность «О» (нет сигнала) и «1» (есть сигнал). Набор физических измерений называется выборкой, а отдельное измерение - отсчетом.
АЦП - это устройство, предназначенное для преобразования непрерывного колебания (аналогового сигнала) в последовательность отсчетов, каждый из которых является аппроксимацией соответствующего отсчета входного колебания.
То есть АЦП превращает непрерывный аналоговый сигнал в дискретный цифровой (переводит в вид двоичных кодов), что можно представить в виде двухэтапного процесса: на первом этапе формируется последовательность s(n) = s(t) / / = иТ, в которой отсчеты s(n) представлены с неограниченной точностью; на втором этапе значение каждого отсчета s(n) представляется числом, состоящим из конечного числа двоичных разрядов.
На выходе получается новая последовательность sKt (и). Разность е(п) = s(n) - sKB (п) называется шумом квантования, или шумом АЦП. В АЦП обе операции выполняются одновременно· Каждый отсчет квантованного сигнала на входе цифровой системы с импульсной характеристикой h(n) равен сумме некванто- ванного отсчета s(n) и ошибки квантования е(п), а выходную последовательность у(п) можно представить в виде суммы сигнала и шума квантования, т. е.: у(п) = s(n) * h(n) + е(п) * h(n).
Точность такого представления сигнала зависит от разрядности используемого АЦП, а процесс деления сигнала на отсчеты Называется дискретизацией. Число отсчетов в секунду называется частотой дискретизации. При оцифровке происходит округление сигнала до разряда АЦП. Такой процесс называют квантованием сигнала (т. е. представление сигнала с помощью конечного Числа числовых разрядов).
Операция квантования (или переход от дискретного сигнала К цифровому) происходит с ошибкой, величина которой опреде- Ияется разрядностью АЦП. Разрешение таких устройств обычно Ныражается «весом» единицы младшего разряда (ЕМР).
Диапазон, в котором сохраняется линейная зависимость между величиной входного сигнала и его оцифрованным значением, называется Динамическим диапазоном и определяется в децибеллах. Динамический Диапазон преобразования определяется числом уровней квантования (и) И числом двоичных разрядов АЦП: D = 6n+ 1,8.
Однако реальный динамический диапазон далек от теоретического; °н может быть значительно ниже теоретического (до 10-20 дБ), что соответствует АЦП более низкого разряда.
Такое снижение динамического Диапазона объясняется уровнем собственных шумов АЦП и ЦАП и зави- сит от многих причин. Во-первых, от разрядности изделия, которая обусловливает так называемые «шумы квантования». Во-вторых, от собственных помех изделия и зависящих от используемой элементной базы Шумов электронных компонентов АЦП (неправильно соединенные сигнальные, аналоговые и цифровые компоненты, взаимное влияние аналоговой части на цифровую и т. п.). В-третьих, от наводок от других элементов комплекса (например, ПЭВМ, монитора). В-четвертых, влияют Помехи от источника питания (все импульсные источники питания создают синфазные помехи, импульсные помехи и т. д.).Согласно теореме отсчетов (ее называют теоремой Котельникова), частота дискретизации должна быть по крайней мере в два Раза (а лучше - в два с половиной раза) выше частоты анализируемого сигнала. Эту предельную верхнюю частоту сигнала называют Частотой Найквиста.
Таким образом, частота дискретизации АЦП, использующегося в АРМе, должна быть не ниже 40 кГц. Однако реально только АЦП с Частотой дискретизации более 48 кГц позволяет без искажений записывать полезный сигнал с частотой до 20 кГц. Частота дискретизации в 48 кГц принята в качестве стандарта (AESEBU) для студийной аппаратуры звукозаписи.
В цифровой магнитной звукозаписи принято, что динамический диапазон в 110 дБ позволяет без искажений преобразовывать любой самый сложный акустический сигнал. Этот диапазон можно получить, используя 18-20-разрядный АЦП/ЦАП.
Для введения в память компьютера произвольного звука, предварительно преобразованного с помощью микрофона в электрический сигнал, он разбивается на множество мельчайших дискретных элементов, каждый из которых кодируется с помощью одного или двух байтов. Начиная с некоторого момента измеряется амплитуда сигнала через очень маленький промежуток времени: за одну секунду такие измерения производятся от 8 до 44 тыс. раз. При этом полнота и качество звучания оцифрованного сигнала зависят от двух факторов: как часто (сколько раз в секунду) и с какой точностью измеряется амплитуда сигнала.
Цифровой звук обрабатывается с помощью математических операций, применяемых к отдельным отсчетам сигнала либо к группам отсчетов различной длины. Выполняемые математические операции могут либо имитировать работу традиционных аналоговых средств обработки (микширование двух сигналов - сложение; усй- ление/ослабление сигнала - умножение на константу; модуляция - умножение на функцию и т. п.), либо использовать альтернативные методы (например, разложение сигнала в спектр - ряд Фурье; коррекция отдельных частотных составляющих; затем обратная «сборка» сигнала из спектра).
Для получения записи, близкой к телефонному качеству, требуется частота измерения амплитуды не ниже 8000 герц. При этом для описания амплитуды сигнала достаточно одного байта (таким образом удается закодировать 256 уровней амплитуды сигнала).
Если необходимо получить звук высшего качества, используют частоту измерения амплитуды 44100 герц и 2 байта - для измерения амплитуды сигнала в каждой точке.
В итоге получается, что одна секунда речи телефонного качества в памяти компьютера займет объем 8000* 1 » 8 килобайт, а высшего - 44100*2 » 88 килобайт. Если сигнал стереофонический, то памяти потребуется в два раза больше.
Обработка цифровых сигналов подразделяется на линейную (в реальном времени, над «живым» сигналом) и нелинейную - над предварительно записанным сигналом. Линейная обработка требует достаточного быстродействия вычислительной системы (процессора); в ряде случаев невозможно совмещение требуемого быстродействия и качества, И тогда используется упрощенная обработка с пониженным качеством.
Нелинейная обработка никак не ограничена во времени, поэтому для нее могут использоваться вычислительные средства любой мощности, а время обработки (особенно с высоким качеством) может достигать нескольких минут и даже часов.
Из самых первых специализированных пакетов математической обработки речи, применявшихся в криминалистических исследованиях, следует отметить программы SONA (Германия) и SLIRE-3 (ВЦ РАИ).
В Настоящее время эти пакеты устарели.При создании АРМа эксперта-фоноскописта в 1990 г. специализированные пакеты для автоматизации фоноскопической экспертизы отсутствовали, поэтому было принято решение о создании ряда специализированных программных продуктов, предназначенных Для организуемых в экспертной службе лабораторий видеофоноско- Пических исследований.
Первой такой специализированной системой, внедренной в Практических органах, явилась программа CR1SS (совместная разработка ЭКЦ и специалистов фирмы «Абико», г. Москва). Она была Рассчитана только на визуализацию акустического сигнала и позволяла оцифровывать аналоговый сигнал, выполнять различные редакторские функции, а также проводить осциллографический и спектральный анализ сигнала (включая построение динамических сонограмм) и вычислять основной тон голоса.
Опыт, накопленный при разработке этого пакета, позволил приступить к созданию серии принципиально новых компьютерных Программ, позволяющих решать в полном объеме конкретные фоно- скопические задачи; первым был разработан пакет SIS (разработка специалистов ЭКЦ и Центра речевых технологий). Для решения задачи автоматизации экспертизы идентификации личности по голосу был выбран список визуализируемых и вычисляемых параметров (временное и спектральное разрешение и т. д.). Первая версия программы создана в 1991 г.
Пакет программ SIS позволяет:
- осуществлять ввод/вывод аналоговых сигналов в компьютер й Пз компьютера;
- проводить запись вводимого сигнала на жесткий диск или в ОЗУ ПЭВМ в реальном масштабе времени;
- выполнять различные функции редактирования введенного в Компьютер сигнала в цифровой форме (расставлять границы участков сигнала, проводить компиляцию в произвольном порядке «нарезанных» фрагментов исходного сигнала, изменять амплитуды и длительность участков сигнала, нормировать сигнал и т. д.);
- прослушивать файлы сигнала и его фрагментов;
- производить предварительную очистку сигнала от посторонних шумов и помех с использованием различных алгоритмов цифровой фильтрации сигнала;
- вводить транскрипцию текста звукозаписи в символах между' народной транскрипции, сохранять транскрипцию совместно с сигналом и осуществлять ее коррекцию;
- осуществлять визуализацию сигналов путем построения осциллограмм, спектрограмм, динамических спектрограмм (цветных и чернобелых двух- и трехмерных сонограмм), динамических кепстрограмМ, кривых основного тона, траекторий формантных структур ит.д.;
- производить для выбранных фрагментов сигналов измерение основных параметрических характеристик (длительность и амплитуда участка, мгновенный и средний спектры БПФ, функции частоты основного тона участка сигнала с вычислением статистических характеристик кривых частоты основного тона, вещественный кепстр, функции автокорреляции, коэффициенты линейного предсказания и т. д.);
- сравнивать параметрические характеристики нескольких речевых сигналов (средние спектры образцов сигналов, статистические характеристики кривых основного тона образцов сигналов, средние характеристики кепстров, коэффициентов автокорреляции, линейного предсказания, частной автокорреляции, формантных структур на опорных участках фонограмм);
-документировать промежуточные и конечные результаты.
На вооружении экспертов-фоноскопистов экспертной службы имеются также изделия фирмы Key Elemetrics (США). Фирма выпускает два программно-аппаратных комплекса: цифровой сонограф (моД· 5500) и система CSL (компьютеризированная лаборатория по обработке речи). Цифровой сонограф позволяет проводить цифровую двухканальную запись на магнитный диск речевого сигнала с разрешением 16 бит (частота дискретизации 82 кГц, динамический диапазон 87 дБ), редактировать сигнал, проводить его спектральный анализ с использованием сигнального процессора. Система CSL (мод. 4300) представляет собой комплекс на основе ПЭВМ типа IBM PC, оборудованный 16-разрядныМ АЦП/ЦАП (2 канала, частота дискретизации до 100 кГц, динамический диапазон 80 дБ) с антиэлайзинговыми фильтрами, двумя сигнальными процессорами 7MS320C25 с фиксированной точкой и дополнительными приспособлениями (включая микрофон и наушники). Система позволяет проводить визуализацию сигнала, его осциллографический И спектральный анализ, отслеживать форманты, вычислять частоту основного тона речи и т. д. Возможности системы CSL аналогичны возможностям пакета SIS, однако она более проста для использования.
Также экспертам-фоноскопистам необходимо знать и возможности иных программ обработки звука, так называемых звуковых Редакторов.
Не существует общепринятого определения звукового редактора (Иногда употребляют термин «аудиоредактор»). Можно предложить его бедующее определение: звуковой редактор - это компьютерная программа, предназначенная для осуществления различных преобразований и монтажа звуковых сигналов, представленных в цифровом виде.
Под термином «звуковой редактор» обычно понимают програм- **У, которая позволяет производить над звуковым файлом стандартные редакторские функции: выделить, копировать, вырезать и вста- Нить. Но чаще программа помогает осуществлять над файлом и спе- Нифическую «звуковую» обработку: реверберацию, изменения Тембра, частотного спектра и т. д. И третий вид действий, который °бычно имеется в арсенале звуковых редакторов, - работа с форматом звукового файла, т. е. изменение частоты сэмплирования.
В современных звуковых редакторах можно условно выделить Четыре группы операций по редактированию:
- простейшее редактирование;
- звуковые процессы;
- звуковые эффекты;
- дополнительные инструменты.
При редактировании сигналов и их компьютерной обработке °бычно работают не со всем файлом, а с отдельными его фрагментами.
В большинстве аудиоредакторов предусмотрена возможность отмены пользователем неудачной команды с помощью функции Undo. причем вся работа по редактированию проводится не с исходным фай- ■Ч°м, а с его копией, которая хранится в памяти компьютера или на дис- Ке в виде временных файлов. Физически обработанный файл изменяет- Ся только после соответствующей команды сохранения.
К преобразованию звука прибегают в целях изменения каких-то ег° характеристик, а также для создания различных звуковых эффектов, очистки звука от нежелательных шумов, изменения тембра 11 т. п. Все эти преобразования могут осуществляться с помощью бедующих методов компьютерной обработки и редактирования сИгналов.
Редактирование. Вырезание из записи одних участков, вставка других, их замена, размножение и т. п. Все современные музыкальные звуко- и видеозаписи в той или иной мере подвергаются монтажу. То есть, в отличие от криминалистических исследований, монтажом фонограммы в технологиях мультимедиа называют компоновку и редактирование звукового файла.
Амплитудные преобразования выполняются при помощи действий над амплитудой сигнала двумя способами: умножение амплитуды сигнала на некоторое фиксированное число (на постоянный коэффициент)) в результате чего получают одинаковое изменение (усиление или ослабление) интенсивности сигнала на всей его протяженности; или изменение амплитуды сигнала по какому-то закону, т. е. умножение амплитуды сигнала на модулирующую функцию (функцию-модулятор)· Этот процесс называется амплитудной модуляцией. Частным случаем амплитудной модуляции является формирование огибающей для придания стационарному звучанию развития во времени.
Амплитудные преобразования выполняются последовательно с отдельными сэмплами, поэтому они просты в реализации и не требуют большого объема вычислений.
Частотные (спектральные) преобразования выполняются над частотными составляющими звука. Если использовать спектральное разложение (форму представления звука, в которой по горизонтали отсчитываются частоты, а по вертикали - интенсивности состай' ляющих этих частот), то многие частотные преобразования становятся похожими на амплитудные преобразования над спектром. Например, фильтрация (усиление или ослабление определенных полос частот) сводится к наложению на спектр соответствующей амплитудной огибающей.
Фазовые преобразования выполняются путем постоянного сдвига фазы сигнала либо путем ее модуляции некоторой фазомодулирую- щей функцией. Такие фазовые преобразования стереосигнала позволяют получить эффект вращения звука, эффект «объёмности» звука.
Временные преобразования реализуются путем наложения на сигнал его копий, сдвинутых во времени на различные величины. При сдвигах на величины, сравнимые с периодом сигнала, эти преобразования пре* вращаются в фазовые; при небольших сдвигах за пределами период? (примерно менее 20 мс) это дает эффект, близкий к хоровому (размножение источника звука); при больших сдвигах - эффекты многократного отражения: реверберации (20..50 мс) и эха (более 50 мс).
Формантные преобразования являются частным случаем частотных преобразований и оперируют с формантами (усиленными участками спектра звуков, произносимых человеком).
Каждому звуку соответствует свое соотношение амплитуд и Частот нескольких формант, которое определяет тембр и разборчивость голоса. Изменяя параметры формант, можно изменять восприятие тембра и высоты голоса, подчеркивать или затушевывать отдельные звуки, сдвигать регистр голоса и т. п.
С акустической точки зрения речевой сигнал поддается разбивке на Четыре группы участков, различающихся по характеру источника звука: Лауза, голосовой, шумовой и голосовой в совокупности с шумовым источники звука. Такая классификация не является вполне адекватной и Чребует введения дополнительных групп: импульсных источников, импульсных с голосовым источником и др. Однако она оказалась удобной Для проведения первых фундаментальных акустических исследований И развития акустической теории речеобразования.
В криминалистической фоноскопии используется упрощенная клас- сификация участков речевых сигналов, включающая в себя три группы.
К первой группе относятся участки сигнала, на которых отражена работа голосовых связок (тональные участки речевого сигнала). К ним относятся участки гласных и звонких согласных звуков.
Вторая группа - это участки речевого сигнала, на которых амплитуда сигнала не равна нулю, но голосовые связки не работают (йетональные участки речевого сигнала). К ним относятся, например, шипящие и взрывные звуки.
Третья группа - это участки речевых пауз. В совокупности с тональными и нетональными участками речевого сигнала, составляющими в целом речевой сигнал определенной фразы, паузы отражают Индивидуальные особенности речи.
Исходя из существующих компьютерных методов обработки Речевого сигнала, к выбору параметров, которые могут быть использованы в ходе фоноскопической экспертизы, предъявляют следующие требования:
• наиболее отражающие индивидуальные особенности речи;.
• надежно выделяемые из речевого сигнала;
• наименее искажаемые аппаратурой звукопередачи и записи;
• поддающиеся измерению в шумах с высокой степенью точности.
Среди этих параметров можно выделить следующие: периодичность работы голосовых связок, периодичность следования тональных участков речевого сигнала, длительность периодов смычных и сМычно-проходных звуков и т. п.
Одной из информативных совокупностей таких признаков являют- ся параметры узкополосных спектров тональных участков, отражающих периодичность работы голосовых связок. Высокая информативность этой совокупности обусловлена проявлением в ней индивидуальных особенностей одновременно двух систем: анатомического Щроения и нейрофизиологического регулирования голосообразования.
Звуковые паузы и нетональные участки речевых сигналов менее информативны для решения криминалистических задач. Обычно на практике используются следующие основные параметры этих участков: их длительность и (если проявляются) резонансные особенности ШИПЯЩИХ звуков в области частот ниже 4—6 кГц.
Остальные параметры (например, форма и спектр импульса взрывного звука) обычно не используются из-за сильного искажения и принципиальной невозможности допустимо точного оценивания в шумах (в силу их одиночное™ в окрестности квазипостоянства характеристик искажающих факторов).
3.
Еще по теме Компьютерные методы и цифровая обработка сигналов звука в фоноскопии:
- Методы обработки и изучения фактического материала
- 2. Установление фактов и обстоятельств неправомерного доступа к компьютерной информации во встроенных и интегрированных компьютерных средствах
- § 5. Методы и средства экспертного исследования компьютерных средств
- 1.1. Понятие криминалистической фоноскопии
- Электронная цифровая подпись
- § 2. Проблемы применения цифровой фиксации информации
- Нужно ли каждому цифровое имя?
- Международные документы об авторском праве в цифровой среде
- 7.2. Правовые аспекты применения электронной цифровой подписи
- Аудитивный анализ в фоноскопии
- Сканеры. Особенности, запечатления и обработки изображений.
- 16. Электронная цифровая подпись
- 12.5.3. Конвенция о нераспространении несущих программы сигналов, передаваемых через спутники (Конвенция о спутниках, Брюссель, 21 мая 1974 г.) ИСТОРИЯ КОНВЕНЦИИ
- Естественнонаучные основы фоноскопии
- Фонетические основы фоноскопии