Kling 4 переопределяет ИИ-кинематографию
Состоялся запуск Kling 4.0 от Kuaishou, что знаменует собой существенный прогресс в генерации видео с помощью ИИ. Модель теперь создает клипы продолжительностью до 30 секунд за один проход, что вдвое превышает 15-секундный максимум Kling 3.0. Выходные данные достигают разрешения 4K с 10-битным HDR, что значительно повышает визуальную точность и делает Kling 4.0 прямым конкурентом таким признанным моделям, как Seedance.
Новые инструменты творческого контроля предоставляют пользователям большую точность при работе с генерируемым контентом. Kling 4.0 поддерживает до 10 ключевых кадров, позволяя детально управлять движением, темпом и композицией внутри сцены. Кроме того, пользователи могут использовать до 15 мультимодальных референсов — включая изображения, видеоклипы и голосовые сэмплы — для обеспечения единообразия внешнего вида персонажей, деталей продукта и характеристик голоса, одновременно улучшая пространственное восприятие в сложных кадрах.
Генерация аудио претерпела значительные улучшения, решив постоянную проблему предыдущих версий. Kling 4.0 теперь генерирует двухканальный стереозвук одновременно с видео. Это обновление критически важно для устранения рассинхронизации губ, которая была характерна для Kling 3.0, добавляя новый уровень реализма и поддерживая точную синхронизацию на нескольких языках, включая:
- Китайский
- Английский
- Японский
- Корейский
- Испанский
- Португальский
- Немецкий
- Французский
- Хинди
Модель Flash, доступная в раннем доступе и ограниченная разрешением 720p, предшествует более широкому развертыванию полной модели Kling 4.0, ожидаемому в октябре. Эта итерация представляет собой комплексное обновление как технических возможностей, так и творческой гибкости для ИИ-кинематографии, предлагая инструменты, которые оптимизируют сложные рабочие процессы видеопроизводства.
Gemini 4 от Google пробуждает спящего гиганта
Google представила Gemini 4 Argon, свою новую флагманскую модель ИИ, призванную вернуть лидерство в конкурентной среде генеративного ИИ у таких соперников, как OpenAI и Anthropic. Этот релиз знаменует собой важный стратегический шаг для технологического гиганта, несмотря на то, что первоначальное развертывание Argon ограничено целевой группой партнеров и разработчиков. Взвешенное внедрение направлено на повышение производительности и интеграции модели перед более широким публичным доступом.
Истинное отличие Argon проявляется в его передовых возможностях понимания видео, которые Google называет «секретной силой». Модель достигла рекордного показателя 91.7 в LVBench, важном отраслевом бенчмарке для понимания длинных видео. Эта высокая производительность подчеркивает способность Gemini глубоко анализировать и интерпретировать расширенный видеоконтент, устанавливая новый стандарт для мультимодальной интерпретации ИИ.
Выпуск Argon имеет существенные стратегические последствия для более широкой экосистемы ИИ Google. Ожидается, что модель придаст значительный импульс развитию творческих инструментов, в частности Nano Banana, за счет предоставления улучшенных бэкендов для обработки видео. Это достижение также может значительно оживить усилия Google в области генерации видео, используя фундаментальное понимание Argon для создания более сложных инструментов визуального творчества. Выход Argon сигнализирует об усилении конкуренции в пространстве мультимодального ИИ.
Ideogram 4.5 наконец исправляет самый большой недостаток ИИ
Ideogram 4.5 направлен на устранение критического ограничения при редактировании изображений с помощью ИИ: проблемы дрейфа (drift problem). Эта проблема обычно снижает качество и согласованность изображения при каждой последующей модификации, заставляя пользователей перезапускать проекты или идти на визуальные компромиссы. Ideogram 4.5 стремится сохранить целостность изображения при итеративных изменениях, что является значительным шагом вперед для творческих рабочих процессов.
Платформа представляет два различных режима редактирования для решения этой проблемы. Precise edit позволяет выполнять точечные, локальные корректировки, не затрагивая другие области изображения. Напротив, Generate + edit способствует более широкому творческому переосмыслению, позволяя вносить существенные изменения при сохранении основной визуальной целостности. Оба режима нативно поддерживают редактирование изображений в высоком разрешении, исключая потерю качества из-за изменения разрешения в процессе работы.
Ideogram 4.5 также устанавливает новый стандарт манипуляции текстом внутри изображений. Теперь пользователи могут изменять стилизованный текст непосредственно в сгенерированных изображениях, модифицируя содержание при сохранении оригинального шрифта, цвета и элементов дизайна. Эта возможность устраняет прежнюю необходимость воссоздавать специфическую текстовую эстетику после первоначальной генерации, предлагая беспрецедентную гибкость. Это представляет собой значительный шаг к бесшовной интеграции текста в визуальные эффекты, созданные ИИ.
Нравится статья? Получайте такие каждое утро на почту.
одно письмо в день · отписка в два клика · без сторонних трекеров
ElevenLabs v4 наделяет ИИ душой
ElevenLabs v4 представляет принципиально новую архитектуру, разработанную для эмоционального резонанса в синтетической речи. Эта система обрабатывает и интерпретирует текстовый контекст для генерации высоковыразительной и нюансированной вокальной подачи. Обновление позволяет голосам ИИ передавать тонкие эмоциональные сдвиги и человекоподобные интонационные паттерны, выходя за рамки прежних ограничений плоских или чрезмерно драматичных результатов.
Сопутствующая модель v4 Turbo может похвастаться впечатляющей производительностью, достигая задержки, близкой к реальному времени (около 150 миллисекунд до начала речи). Это быстрое время отклика значительно превосходит конкурирующие предложения от OpenAI и Cartesia, что делает ElevenLabs v4 Turbo особенно подходящим для требовательных агентных приложений. Такие приложения, как живые ИИ-ассистенты или интерактивные персонажи, требуют немедленного и плавного аудиовзаимодействия.
Ключевое улучшение удобства использования включает переход от сложных элементов управления SSML (язык разметки синтеза речи) к интуитивно понятным аудиотегам на естественном языке. Теперь пользователи могут встраивать специфические вокализации и эмоциональные сигналы непосредственно в текстовые подсказки с помощью простых команд. Например, такие выражения, как [whispers], [laughter], [sighs] или [gasp], обеспечивают доступное и точное руководство для продвинутой генерации аудио, демократизируя выразительную ИИ-речь.
Часто задаваемые вопросы
Каковы основные улучшения в Kling 4?
Kling 4 увеличивает длительность видео до 30 секунд, добавляет нативный стереозвук с улучшенной синхронизацией губ, предлагает разрешение 4K и расширяет контроль пользователя с помощью до 10 ключевых кадров для точного движения.
Доступна ли Google Gemini 4 для широкой публики?
Нет. Новая флагманская модель под названием Argon в настоящее время находится в ограниченном доступе для избранных партнеров по кибербезопасности и еще не доступна широкой публике.
Какую проблему решает Ideogram 4.5 при редактировании изображений?
Ideogram 4.5 создан для предотвращения «дрейфа» — нежелательных смещений пикселей, изменений цвета или текстурных артефактов, которые возникают в других моделях после многократных правок. Он точно изменяет только то, что запрашивает пользователь.
Как ElevenLabs v4 улучшает генерацию голоса ИИ?
ElevenLabs v4 фокусируется на эмоциональной подаче путем интерпретации контекста, тона и темпа. Модель v4 Turbo достигает задержки в реальном времени (~150 мс до начала речи), что делает ее идеальной для живых агентов.

