Skip to content
ai news

AI의 '버전 4' 혁명이 시작되었습니다

비디오부터 음성까지, 모든 주요 AI 모달리티에 '버전 4' 업데이트의 물결이 몰아치고 있습니다. 이는 단순한 점진적 개선이 아니라, 창의적 환경을 재정의하는 조직적인 도약입니다.

Jonah Park
AI의 '버전 4' 혁명이 시작되었습니다

Kling 4, AI 영화 제작을 재정의하다

Kuaishou의 Kling 4.0이 출시되며 AI 비디오 생성 분야에 상당한 진전을 이루었습니다. 이 모델은 이제 한 번의 생성으로 최대 30초 길이의 클립을 제작할 수 있어, Kling 3.0의 최대 15초 대비 두 배로 늘어났습니다. 출력물은 10비트 HDR을 포함한 4K 해상도에 도달하여 시각적 충실도를 크게 높였으며, Kling 4.0을 Seedance와 같은 기존 모델에 대한 강력한 경쟁자로 자리매김하게 했습니다.

새로운 창의적 제어 기능은 사용자가 생성된 콘텐츠를 더욱 정밀하게 조작할 수 있도록 지원합니다. Kling 4.0은 최대 10개의 키프레임을 지원하여 장면 내 움직임, 속도, 구도를 세밀하게 조정할 수 있습니다. 또한 사용자는 이미지, 비디오 클립, 음성 샘플을 포함한 최대 15개의 멀티모달 참조를 통합하여 캐릭터 외형, 제품 세부 정보, 음성 특성의 일관성을 유지하고 복잡한 샷 내에서 공간 인지 능력을 향상시킬 수 있습니다.

오디오 생성 기능도 크게 개선되어 이전 버전의 고질적인 문제를 해결했습니다. Kling 4.0은 이제 비디오와 함께 2채널 스테레오 오디오를 기본적으로 생성합니다. 이 업데이트는 Kling 3.0에서 발생했던 립싱크 어긋남 문제를 결정적으로 해결하여 새로운 차원의 사실감을 더했으며, 다음을 포함한 여러 언어에서 정확한 동기화를 지원합니다:

  • 중국어
  • 영어
  • 일본어
  • 한국어
  • 스페인어
  • 포르투갈어
  • 독일어
  • 프랑스어
  • 힌디어

현재 720p 출력으로 제한된 얼리 액세스 Flash 모델은 10월에 예정된 Kling 4.0 정식 모델의 광범위한 출시를 앞두고 공개되었습니다. 이번 버전은 기술적 역량과 창의적 유연성 모두에서 AI 기반 영화 제작을 위한 포괄적인 업그레이드를 의미하며, 복잡한 비디오 제작 워크플로우를 간소화하는 도구를 제공합니다.

Google의 Gemini 4, 잠자는 거인을 깨우다

Google은 OpenAI 및 Anthropic과 같은 경쟁사로부터 생성형 AI 시장의 주도권을 되찾기 위해 새로운 플래그십 AI 모델인 Gemini 4 Argon을 선보였습니다. Argon의 초기 출시가 특정 파트너 및 개발자 그룹으로 제한됨에도 불구하고, 이번 출시는 거대 기술 기업인 Google에게 중요한 전략적 행보를 의미합니다. 신중한 배포는 더 넓은 대중 공개에 앞서 모델의 성능과 통합을 개선하기 위한 목적입니다.

Argon의 진정한 차별점은 Google이 '비밀 무기'라고 홍보하는 고급 비디오 이해 능력에서 드러납니다. 이 모델은 장문 비디오 이해도를 평가하는 중요한 업계 벤치마크인 LVBench에서 91.7점이라는 최고 점수를 기록했습니다. 이러한 높은 성능은 Gemini가 확장된 비디오 콘텐츠를 깊이 있게 분석하고 해석할 수 있음을 입증하며, 멀티모달 AI 해석의 새로운 표준을 제시합니다.

Argon의 출시는 Google의 더 넓은 AI 생태계에 상당한 전략적 영향을 미칩니다. 이 모델은 향상된 비디오 처리 백엔드를 제공함으로써 Nano Banana와 같은 하위 창의적 도구들에 상당한 추진력을 제공할 것으로 기대됩니다. 이러한 발전은 또한 Argon의 기초적인 이해 능력을 활용하여 더욱 정교한 시각적 콘텐츠 제작 도구를 구동함으로써, Google의 비디오 생성 분야 진출을 크게 활성화할 수 있습니다. Argon의 등장은 멀티모달 AI 분야의 경쟁이 더욱 치열해질 것임을 예고합니다.

Ideogram 4.5, 마침내 AI의 가장 큰 결함을 수정하다

Ideogram 4.5는 AI 이미지 편집의 치명적인 한계인 드리프트 문제(drift problem)를 해결합니다. 이 문제는 일반적으로 수정이 반복될 때마다 이미지 품질과 일관성을 저하시켜, 사용자가 프로젝트를 처음부터 다시 시작하거나 시각적 타협을 수용하게 만듭니다. Ideogram 4.5는 반복적인 변경 과정에서도 이미지의 무결성을 유지하는 것을 목표로 하며, 이는 창의적인 워크플로우에 있어 중요한 진전을 의미합니다.

이 플랫폼은 이 문제를 해결하기 위해 두 가지 독특한 편집 모드를 도입했습니다. Precise edit는 다른 이미지 영역에 영향을 주지 않고 국소적인 정밀 조정을 가능하게 합니다. 반면, Generate + edit는 더 광범위한 창의적 재구상을 지원하여 핵심적인 시각적 일관성을 유지하면서도 상당한 수정을 가할 수 있게 합니다. 두 모드 모두 고해상도 이미지 편집을 기본적으로 지원하여, 과정 중 해상도 변경으로 인한 품질 저하를 제거했습니다.

Ideogram 4.5는 이미지 내 텍스트 조작에 대한 새로운 표준을 제시합니다. 이제 사용자는 생성된 이미지 내에서 스타일이 적용된 텍스트를 직접 변경할 수 있으며, 원래의 폰트, 색상 및 디자인 요소를 유지하면서 내용을 수정할 수 있습니다. 이 기능은 초기 생성 후 특정 텍스트 미학을 다시 만들어야 했던 기존의 번거로움을 없애고 전례 없는 유연성을 제공합니다. 이는 AI 생성 비주얼에 텍스트를 매끄럽게 통합하는 데 중요한 진전입니다.

이 글이 마음에 드셨나요? 매일 아침 이런 글을 메일로 받아보세요.

하루 한 통 · 두 번의 클릭으로 구독 취소 · 제3자 추적 없음

ElevenLabs v4, AI에 영혼을 불어넣다

ElevenLabs v4는 합성 음성에서 감정적 공명(emotional resonance)을 이끌어내기 위해 설계된 근본적으로 새로운 아키텍처를 도입했습니다. 이 시스템은 텍스트 맥락을 처리하고 해석하여 매우 표현력이 풍부하고 미묘한 차이가 있는 음성을 생성합니다. 이번 업그레이드를 통해 AI 음성은 이전의 단조롭거나 지나치게 극적인 출력의 한계를 넘어 미묘한 감정 변화와 인간과 같은 억양 패턴을 전달할 수 있게 되었습니다.

함께 제공되는 v4 Turbo 모델은 인상적인 성능을 자랑하며, 첫 음성 출력까지 약 150밀리초의 실시간 지연 시간(real-time latency)에 가까운 성능을 달성합니다. 이 빠른 응답 시간은 OpenAI 및 Cartesia의 경쟁 제품을 크게 앞지르며, ElevenLabs v4 Turbo를 실시간 AI 비서나 대화형 캐릭터와 같이 즉각적이고 유연한 오디오 상호작용이 필요한 에이전트 애플리케이션에 특히 적합하게 만듭니다.

주요 사용성 개선 사항으로는 복잡한 SSML(Speech Synthesis Markup Language) 제어에서 직관적인 자연어 오디오 태그(natural-language audio tags)로의 전환이 있습니다. 이제 사용자는 간단한 명령어를 사용하여 특정 발성 및 감정적 신호를 텍스트 프롬프트에 직접 삽입할 수 있습니다. 예를 들어, [whispers](속삭임), [laughter](웃음), [sighs](한숨), [gasp](헐떡임)와 같은 표현은 고급 오디오 생성을 위한 접근 가능하고 정밀한 지침을 제공하여 표현력 있는 AI 음성을 대중화합니다.

자주 묻는 질문

Kling 4의 주요 개선 사항은 무엇인가요?

Kling 4는 비디오 길이를 30초로 두 배 늘리고, 립싱크가 개선된 기본 스테레오 오디오를 추가했으며, 4K 해상도를 제공하고, 최대 10개의 키프레임을 통해 정밀한 움직임을 제어할 수 있도록 사용자 제어 기능을 강화했습니다.

Google의 Gemini 4를 일반 대중이 사용할 수 있나요?

아니요. Argon이라는 이름의 새로운 플래그십 모델은 현재 일부 사이버 보안 파트너를 대상으로 제한적으로 출시되었으며, 아직 일반 대중에게는 널리 공개되지 않았습니다.

Ideogram 4.5는 이미지 편집의 어떤 문제를 해결하나요?

Ideogram 4.5는 다른 모델에서 여러 번 편집한 후 발생하는 원치 않는 픽셀 이동, 색상 변화 또는 텍스트 아티팩트와 같은 '드리프트' 현상을 방지하도록 구축되었습니다. 사용자가 요청한 부분만 정밀하게 변경합니다.

ElevenLabs v4는 AI 음성 생성을 어떻게 개선했나요?

ElevenLabs v4는 맥락, 어조, 속도를 해석하여 감정적인 전달에 중점을 둡니다. v4 Turbo 모델은 실시간 지연 시간(첫 음성까지 약 150ms)을 달성하여 실시간 에이전트에 이상적입니다.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

빌더를 위해

이 페이지는 지금 다른 사람의 도구를 위해 일하고 있습니다.

AI 에이전트가 읽고, 구매자가 도착합니다. 8개 언어와 MCP로 답합니다. 당신의 도구도 가질 수 있습니다 — 24시간 안에 공개.