Команда FlashLabs анонсировала выход Chroma 1.0, первой полностью открытой модели, которая реализует схему «голос → голос» без преобразования в текст. Главная особенность Chroma заключается в том, что она представляет собой end to end систему, что существенно сокращает задержки и исключает искажения, характерные для традиционных каскадных методов. Задержка составляет менее 150 миллисекунд, что приближает ее к уровню живого общения, что критически важно для применения в голосовых ассистентах и переводчиках.
Клонирование голоса требует всего несколько секунд аудио, а степень схожести достигает 0.817, что является впечатляющим показателем для открытой модели. FlashLabs сделали доступными веса, код и документацию, что упрощает внедрение и снижает стоимость работы с моделью.
Chroma 1.0 может стать серьезной альтернативой закрытым решениям для стартапов и исследователей, стремящихся контролировать свои данные и модели. Ожидается, что вскоре сообщество оценит, насколько действительно революционным станет Chroma в данной области.