Ученые из США разработали усовершенствованную систему для наушников, которая переводит речь нескольких людей, говорящих одновременно, сохраняя при этом направление и качество голосов людей, пишет Interesting Engineering.
Разработанная исследователями из Вашингтонского университета, система называется Spatial Speech Translation и состоит из готовых наушников с шумоподавлением, оснащенных микрофонами. Алгоритмы исследовательской группы выделяют разных ораторов в пространстве и следят за их движением, переводят их речь и воспроизводят ее с задержкой в 2-4 секунды.
Система обладает оснащена рядом инноваций. Во-первых, при включении он сразу определяет, сколько динамиков находится в помещении или на открытом воздухе. Ведущий автор и докторант Университета Калифорнии в Школе Аллена Туоча Чен заявил, что их алгоритмы работают как радар.
«Таким образом, они сканируют пространство на 360 градусов и постоянно определяют и уточняют, находится ли там один человек, шесть или семь», - пояснил ученый.
Исследовательская группа подчеркнула, что система переводит речь и сохраняет выразительность и громкость голоса каждого говорящего во время работы на устройстве, например, на мобильных устройствах с чипом Apple M2, таких как ноутбуки и Apple Vision Pro.
Наконец, когда говорящие поворачивают головы, система продолжает отслеживать направление и качество их голоса по мере изменения.
Ученые заявили, что система функционировала при тестировании в 10 помещениях и на улице.

























