Skip to content
ai news

La révolution de la version 4 de l'IA est arrivée

Une vague de mises à jour « version 4 » vient de toucher toutes les principales modalités de l'IA, de la vidéo à la voix. Mais il ne s'agit pas seulement d'une amélioration incrémentale ; c'est un bond coordonné qui redéfinit le paysage créatif.

Jonah Park
La révolution de la version 4 de l'IA est arrivée

Kling 4 redéfinit la cinématographie par IA

Kling 4.0 de Kuaishou a été lancé, marquant une avancée substantielle dans la génération de vidéo par IA. Le modèle génère désormais des clips allant jusqu'à 30 secondes en un seul passage, doublant le maximum de 15 secondes de Kling 3.0. Les sorties atteignent une résolution 4K avec HDR 10 bits, élevant considérablement la fidélité visuelle et positionnant Kling 4.0 comme un concurrent direct des modèles établis comme Seedance.

De nouveaux contrôles créatifs offrent aux utilisateurs une plus grande précision sur le contenu généré. Kling 4.0 prend en charge jusqu'à 10 images clés, permettant une direction affinée du mouvement, du rythme et de la composition au sein d'une scène. De plus, les utilisateurs peuvent intégrer jusqu'à 15 références multimodales — notamment des images, des clips vidéo et des échantillons vocaux — pour assurer une apparence cohérente des personnages, des détails des produits et des caractéristiques vocales, tout en améliorant la conscience spatiale dans les plans complexes.

La génération audio connaît des améliorations significatives, résolvant un problème persistant des versions précédentes. Kling 4.0 génère désormais nativement un audio stéréo à deux canaux avec la vidéo. Cette mise à jour résout de manière critique le décalage de synchronisation labiale qui affectait Kling 3.0, ajoutant une nouvelle couche de réalisme et prenant en charge une synchronisation précise dans plusieurs langues, notamment :

  • Chinois
  • Anglais
  • Japonais
  • Coréen
  • Espagnol
  • Portugais
  • Allemand
  • Français
  • Hindi

Le modèle Flash en accès anticipé, actuellement limité à une sortie 720p, précède le déploiement plus large du modèle complet Kling 4.0, prévu en octobre. Cette itération représente une mise à niveau complète à la fois en termes de capacité technique et de flexibilité créative pour la cinématographie pilotée par l'IA, offrant des outils qui rationalisent les flux de travail complexes de production vidéo.

Gemini 4 de Google réveille un géant endormi

Google a présenté Gemini 4 Argon, son nouveau modèle d'IA phare, positionné pour reprendre l'élan dans le paysage concurrentiel de l'IA générative face à des rivaux comme OpenAI et Anthropic. Ce lancement marque un mouvement stratégique important pour le géant de la technologie, bien que le déploiement initial d'Argon reste limité à un groupe ciblé de partenaires et de développeurs. Le déploiement mesuré vise à affiner les performances et l'intégration du modèle avant un accès public plus large.

La véritable distinction d'Argon réside dans ses capacités avancées de compréhension vidéo, que Google présente comme un « pouvoir secret ». Le modèle a atteint un score de 91,7, en tête du classement LVBench, une référence industrielle cruciale pour la compréhension de vidéos longues. Cette haute performance souligne la capacité de Gemini à analyser et interpréter en profondeur le contenu vidéo étendu, établissant une nouvelle norme pour l'interprétation multimodale par IA.

La sortie d'Argon comporte des implications stratégiques substantielles pour l'écosystème IA plus large de Google. Le modèle devrait générer un élan considérable pour les outils créatifs en aval, notamment Nano Banana, en fournissant des backends de traitement vidéo améliorés. Cette avancée pourrait également relancer de manière significative la poussée de Google dans la génération vidéo, en tirant parti de la compréhension fondamentale d'Argon pour alimenter des outils de création de contenu visuel plus sophistiqués. L'entrée d'Argon signale une intensification de la concurrence dans l'espace de l'IA multimodale.

Ideogram 4.5 corrige enfin le plus grand défaut de l'IA

Ideogram 4.5 cible une limitation critique de l'édition d'images par IA : le problème de dérive (drift problem). Ce défi dégrade généralement la qualité et la cohérence de l'image à chaque modification successive, forçant les utilisateurs à redémarrer leurs projets ou à accepter des compromis visuels. Ideogram 4.5 vise à préserver l'intégrité de l'image grâce à des changements itératifs, marquant une avancée significative pour les flux de travail créatifs.

La plateforme introduit deux modes d'édition distincts pour résoudre ce problème. Precise edit permet des ajustements chirurgicaux et localisés sans affecter les autres zones de l'image. À l'inverse, Generate + edit facilite une réimagination créative plus large, permettant des modifications substantielles tout en maintenant une cohérence visuelle fondamentale. Les deux modes prennent nativement en charge l'édition d'images haute résolution, éliminant toute dégradation de la qualité due aux changements de résolution pendant le processus.

Ideogram 4.5 établit également une nouvelle norme pour la manipulation de texte dans les images. Les utilisateurs peuvent désormais modifier le texte stylisé directement au sein des images générées, en changeant le contenu tout en préservant la police, la couleur et les éléments de design originaux. Cette capacité élimine la nécessité antérieure de recréer des esthétiques textuelles spécifiques après la génération initiale, offrant une flexibilité sans précédent. Cela représente une étape significative vers une intégration transparente du texte dans les visuels générés par IA.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

ElevenLabs v4 donne une âme à l'IA

ElevenLabs v4 introduit une architecture fondamentalement nouvelle conçue pour la résonance émotionnelle dans la synthèse vocale. Ce système traite et interprète le contexte textuel pour générer des rendus vocaux hautement expressifs et nuancés. Cette mise à jour permet aux voix IA de transmettre des changements émotionnels subtils et des modèles d'intonation humains, dépassant les limitations précédentes des sorties monotones ou trop dramatiques.

Le modèle compagnon v4 Turbo affiche des performances impressionnantes, atteignant une latence en temps réel d'environ 150 millisecondes avant la première émission vocale. Ce temps de réponse rapide surpasse largement les offres concurrentes d'OpenAI et de Cartesia, rendant ElevenLabs v4 Turbo particulièrement adapté aux applications agentiques exigeantes. Ces applications, telles que les assistants IA en direct ou les personnages interactifs, nécessitent des interactions audio immédiates et fluides.

Une amélioration clé de l'utilisabilité implique le passage de contrôles SSML (Speech Synthesis Markup Language) complexes à des balises audio en langage naturel intuitives. Les utilisateurs peuvent désormais intégrer des vocalisations spécifiques et des indices émotionnels directement dans les invites textuelles avec des commandes simples. Par exemple, des expressions comme [whispers], [laughter], [sighs] ou [gasp] fournissent une direction accessible et précise pour une génération audio avancée, démocratisant la parole IA expressive.

Questions fréquemment posées

Quelles sont les principales améliorations de Kling 4 ?

Kling 4 double la durée des vidéos à 30 secondes, ajoute un son stéréo natif avec une synchronisation labiale améliorée, offre une résolution 4K et renforce le contrôle utilisateur avec jusqu'à 10 images clés pour un mouvement précis.

Le modèle Gemini 4 de Google est-il disponible pour le public ?

Non. Le nouveau modèle phare, nommé Argon, est actuellement en version restreinte pour certains partenaires en cybersécurité et n'est pas encore largement disponible pour le public.

Quel problème Ideogram 4.5 résout-il pour l'édition d'images ?

Ideogram 4.5 est conçu pour empêcher la « dérive » — les décalages de pixels, les changements de couleur ou les artefacts de texture indésirables qui surviennent dans d'autres modèles après plusieurs modifications. Il ne modifie précisément que ce que l'utilisateur demande.

Comment ElevenLabs v4 améliore-t-il la génération de voix par IA ?

ElevenLabs v4 se concentre sur le rendu émotionnel en interprétant le contexte, le ton et le rythme. Le modèle v4 Turbo atteint une latence en temps réel (~150 ms avant la première émission vocale), ce qui le rend idéal pour les agents en direct.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only

Pour les builders

Cette page travaille pour l’outil de quelqu’un d’autre.

Les agents IA la lisent. Des acheteurs y arrivent. Elle répond en huit langues et via MCP. Votre outil peut avoir la sienne — en ligne en 24 heures.