Меню
AiNews UA
  • AI Hub
  • AI Гуманізатор
  • Каталог інструментів ШІ
  • Перевірка на ші
  • Політика конфіденційності
  • Про нас
  • Умови використання
Пошук
Меню
AiNews UAAiNews UAAiNews UAAiNews UA
Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
Підписатися

Що шукаємо?

Новини, AI-інструменти, огляди, гайди та порівняння

Популярне:
ChatGPT Gemini Claude Midjourney AI для бізнесу Генератори зображень

Почніть вводити запит — результати з’являться тут.

    AiNews UAAiNews UAAiNews UA
    Новини AI інструменти Огляди Гайди Порівняння Промпти AI Hub
    Приєднуйтесь до спільноти в Telegram Щоденні AI-новини та добірки
    Українська • © AiNews UA 2026
    Telegram X (Twitter) Facebook LinkedIn

    Нова ШІ-модель від Google може генерувати якісне аудіо з відео

    Фото автора: Володимир Дрозд Володимир Дрозд
    18 червня 2024 • 3 хв читання • 416 переглядів
    Нова ШІ-модель від Google може генерувати якісне аудіо з відео

    Зміст

    1. Що таке Google V2A?
    2. Приклади
    3. Як працює V2A
    4. Обмеження

    За останні кілька тижнів ми побачили безліч нових інструментів для перетворення тексту на відео та зображень на відео, як-от Google Veo, Kling від Kuaishou, Dream Machine від Luma Lab і нещодавно анонсований Runway Gen-3 Alpha.

    Ці ШІ-відеоінструменти дають вражаючі результати, але у них є загальне обмеження – всі вони генерують відео без звуку. Ні діалогів, ні саундтрека, ні звукових ефектів.

    Сьогодні Google поділилася інформацією про розроблювану технологію, яка може генерувати звук із відео.

    Що таке Google V2A?

    Технологія Google Video-to-audio (V2A) об’єднує відеопікселі з текстовими промптами природною мовою для створення багатого звукового супроводу дій на екрані.

    V2A не тільки створює реалістичні звукові ефекти та діалоги, що відповідають персонажам і тону відео, а й може генерувати саундтреки для різних традиційних матеріалів, включно з архівними матеріалами, німими фільмами та багато іншого.

    Приклади

    Ось п’ять прикладів, якими команда Google Deepmind поділилася у своєму блозі:

    1. Барабани:
    Промпт: A drummer on a stage at a concert surrounded by flashing lights and a cheering crowd

    2. Автомобілі:

    cars skidding, car engine throttling, angelic electronic music

    3. Вовк:

    Wolf howling at the moon

    4. Підводна медуза:

    jellyfish pulsating under water, marine life, ocean

    5. Сцена жаху:

    Cinematic, thriller, horror film, music, tension, ambience, footsteps on concrete

    Це вражає!

    Хоча є й обмеження, як-от артефакти та спотворення, загальна якість вихідного сигналу все ж таки достатня, щоб значно поліпшити враження від відео.

    Давно пора доповнити відео, створені ШІ, генератором звуку, і V2A – багатообіцяючий крок у цьому напрямку.

    Як працює V2A

    Google експериментував з різними підходами, щоб знайти найбільш масштабовану архітектуру ШІ для створення аудіо, і метод, заснований на дифузії, забезпечив найреалістичніші результати для синхронізації відео та аудіо.

    Дифузія – це процес, під час якого модель ШІ навчається складати візуальні (нерухомі або рухомі) концепції з піксельного “шуму”, ґрунтуючись на вивченні цих концепцій на основі анотованих зображень або пар відео і тексту.

    Система V2A починає з кодування вхідного відео в стислому вигляді. Використовуючи дифузійну модель, звук ітеративно очищається від випадкового шуму, орієнтуючись на візуальні дані та промпти природної мови, щоб створити синхронізований реалістичний звук. Потім кінцевий аудіосигнал декодується, перетворюється на аудіоформат і об’єднується з відео.

    Щоб поліпшити якість звуку і зорієнтувати модель на конкретні звуки, дослідники додали до процесу навчання створені ШІ анотації з докладними звуковими описами та розшифровками розмовних діалогів. Це дає змогу технології асоціювати конкретні звукові події з різними візуальними сценами на основі наданих анотацій або розшифровок.

    Більш детальну інформацію можна знайти в блозі Google тут.

    Обмеження

    Незважаючи на досягнуті успіхи, Google все ще працює над усуненням низки обмежень:

    • Залежність від якості відео: Якість вихідного аудіосигналу сильно залежить від якості вихідного відео. Артефакти або спотворення у відео, які перебувають за межами навчального розподілу моделі, можуть призвести до помітного зниження якості звуку.
    • Проблеми із синхронізацією губ: Для відео з мовленням V2A намагається генерувати мовлення із вхідних транскриптів і синхронізувати його з рухами губ персонажів. Однак модель генерації парного відео може не враховувати транскрипти, що призводить до розбіжності, яка часто спричиняє нечітку синхронізацію губ.
    • Поєднання аудіо- та відеоелементів: Хоча V2A не вимагає поєднання згенерованого звуку і відео вручну, синхронізація різних звукових елементів, візуальних ефектів і таймінгу залишається складним завданням.

    Команда, що працює над цією технологією, каже, що ведуться подальші дослідження, щоб усунути ці обмеження і розширити можливості системи V2A.

    #Штучний інтелект
    Фото автора: Володимир Дрозд

    Автор матеріалу

    Володимир Дрозд

    Володимир Дрозд — засновник та головний редактор AiNews UA. Автор понад 700 публікацій про штучний інтелект, великі мовні моделі (LLM), AI-агентів та сучасні AI-сервіси. Спеціалізується на новинах OpenAI, Google, Anthropic, xAI, Meta та локальних AI-моделях.

    Показати повністю Згорнути
    Усі матеріали автора →
    ← Попередня стаття Civitai забанив Stable Diffusion 3 Наступна стаття Представлено відкриту LLM модель для коду DeepSeek-Coder-V2 →

    Зміст статті

    Зміст

    1. Що таке Google V2A?
    2. Приклади
    3. Як працює V2A
    4. Обмеження

    Популярні матеріали

    Топ програм ШІ для створення відео та музики у 2024 Топ програм ШІ для створення відео та музики у 2024 3 731 переглядів Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото Добірка ші для діпфейків за один клік. Змінюємо обличчя на фото 3 243 переглядів Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? Найкращі інструменти для створення логотипів з використанням ШІ: що обрати? 2 904 переглядів GPT-5 OpenAI показали GPT-5 на конференції Microsoft 2 832 переглядів Hedra AI - генератор аватарів, які розмовляють Hedra AI – генератор аватарів, які розмовляють 2 699 переглядів

    Головне про AI українською

    Щоденні новини, добірки й корисні інструменти.

    Читати в Telegram
    Без спаму Швидкі оновлення

    Теми

    Штучний інтелект

    Читайте також

    Більше статей →
    Gemini 3.6 Flash
    Штучний інтелект

    Google представила Gemini 3.6 Flash, Flash-Lite та Flash Cyber — що нового

    Google DeepMind офіційно анонсувала одразу три нові моделі сімейства Gemini — Gemini 3.6 Flash, Gemini 3.5 Flash-Lite та спеціалізовану Gemini…

    21.07.2026 • 3 хв читання
    OpenAI представила GPT-5.6 — нове покоління штучного інтелекту
    Штучний інтелект

    OpenAI представила GPT-5.6: моделі Sol, Terra та Luna — що нового

    OpenAI офіційно анонсувала сімейство моделей GPT-5.6, яке включає три окремі варіанти — Sol, Terra та Luna. Компанія змінює підхід до…

    9.07.2026 • 3 хв читання
    OpenAI анонсувала нове сімейство моделей GPT-5.6, до якого входять Sol, Terra та Luna.
    Штучний інтелект

    OpenAI представила GPT-5.6 Sol: нове покоління ШІ для програмування, науки та кібербезпеки

    OpenAI анонсувала нове сімейство моделей штучного інтелекту GPT-5.6, до якого входять три моделі: Sol, Terra та Luna. Флагманська модель GPT-5.6…

    26.06.2026 • 3 хв читання
    AiNews UAAiNews UAAiNews UA

    AiNews UA — перше українське медіа про штучний інтелект. Ми пояснюємо головні ідеї, технології та прориви, що формують майбутнє вже сьогодні.

    Навігація

    • Новини
    • AI інструменти
    • Огляди
    • Гайди
    • Порівняння
    • AI Hub

    Інструменти

    • AI Гуманізатор
    • Перевірка на ШІ
    • Каталог AI-інструментів

    Категорії AI

    • Асистенти
    • Код
    • Бізнес
    • Аудіо
    • Медицина
    • Дані
    • Текст
    • Освіта
    • Зображення та відео
    • Дизайн
    Telegram канал

    Підписка на новини AiNews UA

    Отримуйте найважливіші новини AI та добірки інструментів щотижня.

    Підписатися в Telegram
    Швидкі оновлення Без спаму
    © AiNews UA 2026. Усі права захищені.
    Політика конфіденційності
    Зроблено з ❤️ в Україні 🇺🇦 ↑