Le site Coin World rapporte :
La première fois que quelqu'un utilise l'IA pour faire une vidéo, il passe généralement rapidement par deux phases.
La première est l'excitation. Les personnages bougent, la caméra zoome, et les lumières semblent fonctionner. Après quelques essais, l'excitation est remplacée par un autre sentiment : de beaux plans s'accumulent, mais lorsqu'ils sont mis dans la timeline, cela ne ressemble pas à un film. Cette personne était habillée en noir, mais en changeant d'angle, son col a changé ; il pleuvait une seconde, et la suivante, le sol est sec ; chaque image est belle prise individuellement, mais ensemble, cela ne fonctionne pas.
Seedance 2.5 a porté la limite de génération unique de 15 secondes à 30 secondes, et peut maintenant accepter plus d'images, de vidéos et de références audio à la fois. Après son lancement fin juillet, les discussions ont presque toutes tourné autour de "30 secondes directement sorties". Mais ceux qui ont utilisé des modèles vidéo savent que doubler la durée ne signifie pas simplement attendre un peu plus longtemps.
15 secondes suffisent pour réaliser un mouvement, créer une ambiance ou présenter un produit. À 30 secondes, on commence à avoir la forme minimale d'une histoire : un personnage doit passer d'un état à un autre, l'action doit avoir une cause, et l'émotion doit avoir un point d'ancrage. Si le personnage fait quelques pas de plus, les éléments que le modèle doit retenir augmentent de manière exponentielle.
Lors d'un test par Geek Park, une scène de café a été écrite : un journaliste fixe un document vide, boit du café, commence à taper, la lumière extérieure passe du jaune chaud au bleu profond, et enfin, il ferme son ordinateur. Les mots d'invite ne sont pas compliqués, mais les difficultés se cachent dans le processus : la relation entre la main et la tasse, le changement de lumière à l'extérieur, le rythme de la frappe sur le clavier, l'expression du personnage passant de l'anxiété à la détente. Si ces détails sont erronés à deux ou trois endroits, le public perdra le fil.
Ainsi, la pression apportée par Seedance 2.5 repose d'abord sur les créateurs. Auparavant, écrire "cinématographique, crépuscule, zoom lent" pouvait suffire à obtenir un beau segment ; maintenant, il faut d'abord réfléchir à ce qui se passe réellement dans ces 30 secondes.
L'augmentation de la capacité des matériaux pose également le même problème. Le modèle peut ingérer plus d'images de référence, de vidéos et d'audio, mais les matériaux ne s'alignent pas automatiquement. Quelle image représente le personnage, quelle vidéo n'est qu'un mouvement de caméra, d'où vient la musique, et quels éléments de référence se contredisent, tout cela doit être décidé par quelqu'un. La boîte de saisie redevient un espace de travail.
C'est aussi la raison pour laquelle les termes "intelligent découpage" et "gestion des plans" sont redevenus populaires récemment. Ce qu'ils font n'est pas mystérieux : ils décomposent une vidéo mature en plans, mouvements et musique, permettant aux créateurs de savoir exactement ce qu'ils imitent, puis attribuent les matériaux de référence aux étapes correspondantes.
La génération de vidéos en est arrivée à un point où elle ressemble à la photographie numérique précoce. Les caméras deviennent de plus en plus intelligentes, mais cela n'a pas fait disparaître la composition et le montage, cela a simplement rendu le fait d'appuyer sur le déclencheur moins coûteux. Il en va de même pour les vidéos AI. Le modèle est responsable de la création des matériaux, mais le produit final dépend toujours de la sélection.
Les 30 secondes ont également modifié la répartition des tâches au sein des équipes. À l'ère des courts segments, les personnes les plus familières avec le modèle s'occupaient souvent des mots d'invite, du tirage et du montage initial ; avec une durée plus longue, le script préliminaire et la gestion des actifs reprennent de l'importance. Quels angles doivent être préparés pour le même personnage, quels costumes et accessoires doivent être cohérents dans certains plans, la voix doit-elle être directement générée par le modèle ou ajoutée après, tout cela doit être décidé avant la génération. Sinon, le temps de tournage économisé au début se transformera en un interminable processus de reprise.
C'est aussi là que le terme "50 matériaux de référence" peut être mal interprété. La capacité indique combien d'informations le modèle peut intégrer, mais cela ne garantit pas que chaque information soit comprise de manière égale. Plus il y a de références, plus la probabilité de conflits augmente. Ce que les créateurs doivent faire n'est pas de remplir la capacité, mais de prioriser les matériaux : cette image fixe le visage, ce segment ne fait référence qu'au mouvement, cette piste audio détermine le rythme. À ce stade, les mots d'invite ressemblent davantage à un plan de tournage simplifié.
Les problèmes de droits d'auteur s'amplifient également avec la durée. Un visage similaire, une composition proche d'un film, peuvent passer inaperçus dans une diffusion fragmentée ; mais dans une narration complète, l'origine des personnages, des scènes et de la musique est plus facilement identifiable. Si une équipe commerciale envisage d'utiliser des vidéos générées pour des publicités et des séries, il ne suffit pas de dire "le modèle peut générer", il faut également conserver les sources des matériaux de référence, les étendues de licence et les enregistrements de chaque modification.
Le son ne doit pas non plus être évalué uniquement sur "s'il est généré en synchronisation". Les dialogues sont-ils coupés, le son ambiant s'arrête-t-il soudainement, la musique couvre-t-elle les personnages, tout cela doit être examiné. Une fois que les images sont acceptables, les problèmes qui étaient auparavant résolus par l'enregistrement, le montage et le mixage réapparaîtront un par un dans le processus.
Pour les équipes commerciales, les comptes doivent être encore plus précis. Un gros plan du protagoniste mérite d'être généré plusieurs fois avec un modèle de haute qualité, tandis qu'une scène de rue de une seconde et demie peut ne pas en avoir besoin. Utiliser le modèle le plus coûteux pour chaque plan ne garantit pas un meilleur produit final, mais peut faire exploser la facture de calcul. Pour savoir si les 30 secondes peuvent être utilisées, il ne suffit pas de regarder à quel point la démonstration officielle est impressionnante, il faut voir combien de fois une équipe doit retravailler pour obtenir une version livrable.
Seedance 2.5 est bien sûr une mise à niveau des capacités. Elle a fait avancer la cohérence des personnages et l'expression continue, mais a également transformé la question de "le modèle peut-il créer" en "le créateur sait-il ce qu'il veut".
Une minute, deux minutes viendront tôt ou tard. À ce moment-là, les entreprises de modèles continueront à parler de durée, tandis que ceux qui font réellement des films ne se soucieront probablement que de trois choses : combien de fois cela doit être modifié, combien cela coûte, et si le public est prêt à regarder jusqu'à la fin.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
![[Exclusif] Les échanges de cryptomonnaies étrangers 'non recherchables' en Corée... 65 sur Google et 56 sur Apple](/public-static/35_4563712fa2.png?format=avif)




























