Меню
AiNews UA
  • AI Hub
  • AI Гуманізатор
  • Каталог інструментів ШІ
  • Перевірка на ші
  • Політика конфіденційності
  • Про нас
  • Умови використання
Пошук
Меню
AiNews UAAiNews UAAiNews UAAiNews UA
Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
Підписатися

Що шукаємо?

Новини, AI-інструменти, огляди, гайди та порівняння

Популярне:
ChatGPT Gemini Claude Midjourney AI для бізнесу Генератори зображень

Почніть вводити запит — результати з’являться тут.

    AiNews UAAiNews UAAiNews UA
    Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
    Приєднуйтесь до спільноти в Telegram Щоденні AI-новини та добірки
    Українська • © AiNews UA 2026
    Telegram X (Twitter) Facebook LinkedIn

    Sesame AI демонструє вражаючого голосового помічника з відкритим вихідним кодом

    Фото автора: Володимир Дрозд Володимир Дрозд
    6 березня 2025 • 3 хв читання • 358 переглядів
    Sesame AI демонструє вражаючого голосового помічника з відкритим вихідним кодом

    Sesame AI, каліфорнійський стартап, використовує нетрадиційний підхід до голосового ШІ, навмисно додаючи дефекти у свою мову. Їхня нова модель являє собою перший крок до більш автентичних діалогів і того, що вони називають «присутністю голосу» в системах ШІ.

    Згідно з результатами попереднього тестування, найбільш вражаючими особливостями Sesame є такі тонкі елементи, як мікропаузи, акценти та сміх під час розмови. В одному з діалогів аватар Sesame Майя в режимі реального часу відреагувала на раптовий сміх користувача, продемонструвавши емоційну обізнаність.

    Система навмисно імітує людську поведінку, наприклад, виправляє себе в середині речення і перепрошує за перерви в мовленні. Techradar особливо відзначив ці навмисні недосконалості, підкресливши, що вони відрізняються від відполірованого корпоративного стилю ChatGPT або Gemini.

    У змодельованих сценаріях, як-от обговорення стресу на роботі або планування вечірки, система пропонувала контекстуально відповідні відповіді та запитання, а не використовувала шаблонні фрази.

    Система обробляє мову, використовуючи семантичні маркери для лінгвістичних властивостей і фонетики, а також акустичні маркери для таких характеристик звуку, як висота тону й наголос. Для оптимізації навчання аудіодекодер навчається тільки на одній шістнадцятій частині аудіокадрів, тоді як семантична обробка використовує весь набір даних.

    Модель навчалася на одному мільйоні годин аудіоданих англійською мовою за п’ять епох. Вона може обробляти послідовності з 2048 токенів (близько двох хвилин аудіо) у наскрізній архітектурі. Цей підхід відрізняється від традиційних систем перетворення тексту на мову інтегрованим опрацюванням тексту та аудіо.

    Під час сліпих тестів із Sesame учасники не могли відрізнити CSM від реальних людей під час коротких діалогів. Однак у довших діалогах все ж виявлялися обмеження, такі як випадкові неприродні паузи та звукові дефекти.

    Sesame розробила спеціальні фонетичні тести для оцінки ефективності моделі. У тестах на сприйняття на слух учасники оцінили згенеровану мову як еквівалентну реальним записам, коли вона звучала без контексту, хоча за наявності контексту вони все одно віддавали перевагу оригіналу.

    Sesame планує випустити ключові компоненти свого дослідження у відкритому доступі за ліцензією Apache 2.0. Найближчим часом вони мають намір збільшити масштаб моделі та розширити охоплення навчання, включивши в нього понад 20 мов.

    Компанія акцентує увагу на інтеграції попередньо навчених мовних моделей і створенні систем із повним дуплексом. Ці системи здатні аналізувати динаміку розмови, включно зі зміною мовців, паузами і швидкістю мовлення, безпосередньо на основі даних. Для досягнення цієї мети знадобляться значні зміни у всіх аспектах обробки, починаючи з роботи з даними і закінчуючи методами подальшої обробки.

    «Створити цифрового компаньйона з голосовим супроводом непросто, але ми стабільно просуваємося за кількома напрямками, включно з індивідуальністю, пам’яттю, виразністю і доречністю», – зазначають розробники.

    Компанія Sesame AI, заснована колишнім технічним директором Oculus Бренданом Ірібе і його командою, отримала значне фінансування серії A від Andreessen Horowitz. Демо-версія вже доступна.

    Джерело

    #Штучний інтелект
    Фото автора: Володимир Дрозд

    Автор матеріалу

    Володимир Дрозд

    Володимир Дрозд — засновник та головний редактор AiNews UA. Автор понад 700 публікацій про штучний інтелект, великі мовні моделі (LLM), AI-агентів та сучасні AI-сервіси. Спеціалізується на новинах OpenAI, Google, Anthropic, xAI, Meta та локальних AI-моделях.

    Показати повністю Згорнути
    Усі матеріали автора →
    ← Попередня стаття OpenAI запустила консорціум NextGenai з провідними дослідницькими інститутами Наступна стаття Новий ChatGPT 4.5 «Orion»: у чому особливості та перспективи →

    Популярні матеріали

    Топ програм ШІ для створення відео та музики у 2024 Топ програм ШІ для створення відео та музики у 2024 3 806 переглядів Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото 3 325 переглядів Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? 2 984 переглядів GPT-5 OpenAI показали GPT-5 на конференції Microsoft 2 881 переглядів Hedra AI - генератор аватарів, які розмовляють Hedra AI – генератор аватарів, які розмовляють 2 779 переглядів

    Головне про AI українською

    Щоденні новини, добірки й корисні інструменти.

    Читати в Telegram
    Без спаму Швидкі оновлення

    Теми

    Штучний інтелект

    Читайте також

    Більше статей →
    OpenAI представила ChatGPT Images 2.5: нова модель краще редагує зображення та зберігає деталі
    Штучний інтелект

    ChatGPT Images 2.5: OpenAI представила нову модель генерації зображень

    OpenAI презентувала нове покоління генерації зображень — ChatGPT Images 2.5. Компанія заявляє про підвищення якості, точніше виконання інструкцій, стабільніше редагування…

    8.09.2026 • 4 хв читання
    GPT-6 Astra
    Штучний інтелект

    OpenAI представила GPT-6 Astra: новий етап розвитку штучного інтелекту чи початок ери AGI

    OpenAI презентувала нове покоління штучного інтелекту — модель Astra, яку компанія позиціонує як один із найбільших технологічних стрибків у розвитку…

    3.09.2026 • 3 хв читання
    Gemini 3.8 Flash та Gemini 3.8 Flash Cyber
    Штучний інтелект

    Google представила Gemini 3.8 Flash та Cyber: нові AI-моделі для програмування і кібербезпеки

    Google розширила свою лінійку штучного інтелекту, представивши нові моделі Gemini 3.8 Flash та Gemini 3.8 Flash Cyber. Новинки орієнтовані на…

    2.09.2026 • 2 хв читання
    AiNews UAAiNews UAAiNews UA

    AiNews UA — перше українське медіа про штучний інтелект. Ми пояснюємо головні ідеї, технології та прориви, що формують майбутнє вже сьогодні.

    Навігація

    • Новини
    • AI інструменти
    • Огляди
    • Гайди
    • Порівняння
    • AI Hub

    Інструменти

    • AI Гуманізатор
    • Перевірка на ШІ
    • Каталог AI-інструментів

    Категорії AI

    • Асистенти
    • Код
    • Бізнес
    • Аудіо
    • Медицина
    • Дані
    • Текст
    • Освіта
    • Зображення та відео
    • Дизайн
    Telegram канал

    Підписка на новини AiNews UA

    Отримуйте найважливіші новини AI та добірки інструментів щотижня.

    Підписатися в Telegram
    Швидкі оновлення Без спаму
    © AiNews UA 2026. Усі права захищені.
    Політика конфіденційності
    Зроблено з ❤️ в Україні 🇺🇦 ↑