Сбер открывает доступ к датасету Golos — самому большому набору речевых данных на русском, размеченному вручную - «Умный Дом и решения» » Умный Дом и решения
Сбер открывает доступ к датасету Golos — самому большому набору речевых данных на русском, размеченному вручную - «Умный Дом и решения»
Что такое Умный дом — это система домашних устройств, связанных между собой и выполняющих действия по команде человека или даже без его участия, по расписанию или сигналу от датчика. Некоторые умные дома управляются через приложения и голосом через умные колонки, другие — с помощью отдельных устройств. Задачи тоже могут быть разными: повысить комфорт, сэкономить время или обеспечить безопасность..

СБЕР

Сбер открывает доступ к датасету Golos — самому большому набору речевых данных на русском, размеченному вручную - «Умный Дом и решения»

  • Мстислав
  • 21-мая-2021, 11:47
  • 0 комментариев
  • 1 467 просмотров

Сбер открывает доступ к датасету Golos — самому большому набору речевых данных на русском, размеченному вручную

21 мая 2021. Помимо набора речевых данных на русском языке, датасет Golors включает в себя 1240 часов аудиоданных и обученную на них модель распознавания речи высокой точности. Датасет можно скачать на сайте  GitHub.


Сбер открывает доступ к датасету Golos — самому большому размеченному вручную набору речевых данных на русском языке, включающему 1240 часов аудиоданных, а также обученную на них модель распознавания речи, которая показывает точность, сравнимую с человеческой. Датасет можно скачать на сайте GitHub.

Разрабатывать речевые технологии проще

Данные могут быть использованы для распознавания и синтеза речи. Сбер предоставляет их по лицензии, допускающей использование в исследовательских и коммерческих целях, а это более одного миллиона коротких записей русской речи и соответствующие транскрипции.

Над датасетом работала команда SberDevices: создание такой базы стало возможным благодаря разработке семейства виртуальных ассистентов Салют. Было сгенерировано более 1240 часов речи, похожей на запросы пользователей. Аудиофайлы записаны при помощи краудсорсинговой платформы и специальной студии. Датасет Golos составляют обезличенные записи, прослушанные и размеченные вручную. Точная разметка, полученная благодаря тройному перекрытию, позволяет создавать качественные речевые технологии и продукты.

Помимо данных, Сбер выкладывает обученную на них модель распознавания речи. Она обучалась с использованием мощностей суперкомпьютера «Кристофари» от Сбера на 16 видеокартах Nvidia Tesla V100 в течение восьми дней. Доступная для использования акустическая модель QuartzNet 15×5 была обучена на данных датасетов Golos и Common Voice, а языковая модель KenLM построена на Common Crawl и аннотациях Golos.

Открытие датасета Golos — это очень важный шаг для развития речевых технологий в России, и мы в Сбере рады, что можем применить свой опыт в этой области и продолжить наш тренд делиться своими наработками и технологиями с разработчиками и научным сообществом. Речевые технологии сейчас очень активно внедряются во всех сферах. При этом уже существует масса открытых данных на английском языке, но такого качественного русскоязычного датасета не было. Теперь же есть доступные данные и на русском языке, которые можно использовать для распознавания и синтеза речи, а обученная на них модель показывает очень высокое качество. Мы верим, что датасет Golos даст возможность научному сообществу России двигаться ещё быстрее в совершенствовании русскоязычных речевых технологий

Денис ФилипповCTO SberDevices


SberDevices — компания экосистемы Сбера, центр экспертизы по решениям на основе искусственного интеллекта в таких областях, как речевые технологии, технологии понимания естественного языка, лицевая и голосовая биометрия. Компания также фокусируется на создании умных устройств для конечных потребителей и корпоративных клиентов. SberDevices учреждена в мае 2019 года в качестве Департамента блока «Технологии» Сбербанка.

Другие пресс-релизы
15 июня 2023Пресс-релизЧисло проданных умных устройств Sber с ассистентом Салют превысило 1,5 млн

Число проданных умных устройств Sber с ассистентом Салют превысило полтора миллиона.

6 июня 2023Пресс-релизSberDevices и ГК Softline заключили соглашение о стратегическом сотрудничестве

В рамках партнерства ГК Softline и SberDevices предлагают рынку флагманские B2B-решения вендора: сервис видеоконференций SberJazz, корпоративный мессенджер Dialog, платформу речевых сервисов SaluteSpeech и конструктор для создания чат-ботов SaluteBot.

23 мая 2023Пресс-релизSberDevices получили награду за проект «Построение импортонезависимой аналитической платформы» на Data Award 2023

18 мая состоялось официальное объявление итогов и награждение лауреатов Премии Data Award 2023, учрежденной издательством «Открытые системы» и порталом об ИТ-менеджменте «Директор информационной службы». В номинации «За реализацию антикризисного проекта» победителем был признан проект SberDevices «Построение импортонезависимой аналитической платформы».

Цитирование статьи, картинки - фото скриншот - Rambler News Service.
Иллюстрация к статье - Яндекс. Картинки.
Есть вопросы. Напишите нам.
Общие правила  поведения на сайте.
Сбер открывает доступ к датасету Golos — самому большому набору речевых данных на русском, размеченному вручную 21 мая 2021. Помимо набора речевых данных на русском языке, датасет Golors включает в себя 1240 часов аудиоданных и обученную на них модель распознавания речи высокой точности. Датасет можно скачать на сайте GitHub. Сбер открывает доступ к датасету Golos — самому большому размеченному вручную набору речевых данных на русском языке, включающему 1240 часов аудиоданных, а также обученную на них модель распознавания речи, которая показывает точность, сравнимую с человеческой. Датасет можно скачать на сайте GitHub. Разрабатывать речевые технологии проще Данные могут быть использованы для распознавания и синтеза речи. Сбер предоставляет их по лицензии, допускающей использование в исследовательских и коммерческих целях, а это более одного миллиона коротких записей русской речи и соответствующие транскрипции. Над датасетом работала команда SberDevices: создание такой базы стало возможным благодаря разработке семейства виртуальных ассистентов Салют. Было сгенерировано более 1240 часов речи, похожей на запросы пользователей. Аудиофайлы записаны при помощи краудсорсинговой платформы и специальной студии. Датасет Golos составляют обезличенные записи, прослушанные и размеченные вручную. Точная разметка, полученная благодаря тройному перекрытию, позволяет создавать качественные речевые технологии и продукты. Помимо данных, Сбер выкладывает обученную на них модель распознавания речи. Она обучалась с использованием мощностей суперкомпьютера «Кристофари» от Сбера на 16 видеокартах Nvidia Tesla V100 в течение восьми дней. Доступная для использования акустическая модель QuartzNet 15×5 была обучена на данных датасетов Golos и Common Voice, а языковая модель KenLM построена на Common Crawl и аннотациях Golos. Открытие датасета Golos — это очень важный шаг для развития речевых технологий в России, и мы в Сбере рады, что можем применить свой опыт в этой области и продолжить наш тренд делиться своими наработками и технологиями с разработчиками и научным сообществом. Речевые технологии сейчас очень активно внедряются во всех сферах. При этом уже существует масса открытых данных на английском языке, но такого качественного русскоязычного датасета не было. Теперь же есть доступные данные и на русском языке, которые можно использовать для распознавания и синтеза речи, а обученная на них модель показывает очень высокое качество. Мы верим, что датасет Golos даст возможность научному сообществу России двигаться ещё быстрее в совершенствовании русскоязычных речевых технологийДенис ФилипповCTO SberDevices SberDevices — компания экосистемы Сбера, центр экспертизы по решениям на основе искусственного интеллекта в таких областях, как речевые технологии, технологии понимания естественного языка, лицевая и голосовая биометрия. Компания также фокусируется на создании умных устройств для конечных потребителей и корпоративных клиентов. SberDevices учреждена в мае 2019 года в качестве Департамента блока «Технологии» Сбербанка.Другие пресс-релизы 15 июня 2023•Пресс-релизЧисло проданных умных устройств Sber с ассистентом Салют превысило 1,5 млнЧисло проданных умных устройств Sber с ассистентом Салют превысило полтора миллиона. 6 июня 2023•Пресс-релизSberDevices и ГК Softline заключили соглашение о стратегическом сотрудничествеВ рамках партнерства ГК Softline и SberDevices предлагают рынку флагманские B2B-решения вендора: сервис видеоконференций SberJazz, корпоративный мессенджер Dialog, платформу речевых сервисов SaluteSpeech и конструктор для создания чат-ботов SaluteBot. 23 мая 2023•Пресс-релизSberDevices получили награду за проект «Построение импортонезависимой аналитической платформы» на Data Award 202318 мая состоялось официальное объявление итогов и награждение лауреатов Премии Data Award 2023, учрежденной издательством «Открытые системы» и порталом об ИТ-менеджменте «Директор информационной службы». В номинации «За реализацию антикризисного проекта» победителем был признан проект SberDevices «Построение импортонезависимой аналитической платформы».


Комментарии (0)
img
Датчики Z-Wave от Arlight: движения и открывания двери - «Умный Дом и решения»

Напишу про два датчика Arlight, работающих по протоколу Z-Wave на российской частоте 869МГц. ZW-809-SUF — датчик открывания двери. ...

Категории сайта
Разное

Производитель и новинки производства

Это не только возможность управлять лампочкой со смартфона, а слаженная, незаметная для Вас, работа всех систем дома как инструментов в оркестре.

       89a39215
img
Aqara / Новинки / Производитель / Смарт.ТВ / Умный Дом и решения / Умные Решения
Скидка на установку умных замков Aqara - «Умный Дом»

14 Янв Успейте установить умный замок со скидкой 80% при покупке Aqara А100, N100 и D100 [b]до 30 января. ...

  • Wood
  • 29-01-2025, 12:19
  • 655
img
Aqara / Новинки / Производитель / СТАТЬИ / Умные Решения
Новый поток обучения для частных мастеров в Aqara Aqademy - «Умный Дом»

15 Янв 16 января стартует новый поток обучения для частных мастеров в Aqara Aqademy. Это ваш шанс стать сертифицированным...

  • Clark
  • 29-01-2025, 12:19
  • 641
img
Новинки / Aqara / Производитель / Умный Дом и решения / Умные Решения
Продажи датчика присутствия Aqara Presence Sensor FP2 официально открыты!  - «Умный Дом»

20 Янв Ключевые преимущества датчика: – В отличие от традиционных инфракрасных датчиков, Aqara FP2 использует радиоволны для обнаружения

img
Aqara / Новинки / Умный Дом и решения / Производитель / Умные Решения
Компания Aqara выпустила несколько умных устройств для европейского рынка - «Умный Дом и решения»

Компания Aqara объявила о выпуске целого ряда новых устройств на европейский рынок. Пользователям презентовали новые лампочки выключатели и

img
Новинки / Умный Дом и решения / Производитель / Бренд / Умные Решения
Что ждать от Matter 2.0. Как изменятся умные дома в 2025 году - «Умный Дом и решения»

Представители компании Connectivity Standards Alliance (CSA), которая занимается разработкой стандарта Matter для умного дома, поделились своими

img
Новинки / Производитель / Умный Дом и решения / Умные Решения
Компания TCL представила умный замок K7G Plus с 3D-распознаванием лиц - «Умный Дом и решения»

Компания TCL презентовала новый умный замок K7G Plus. Устройство получило встроенный ИИ и систему разблокировки при помощи сканирования лица

Top.Mail.Ru