SeedRealtime: ByteDance met son IA en appel vidéo permanent, micro toujours ouvert
SeedRealtime est un modèle d'IA full-duplex de ByteDance: il regarde par la caméra, écoute et parle en même temps, au lieu d'attendre la fin de votre phrase pour répondre. Son seul terrain d'essai est Doubao, l'assistant grand public du groupe, où la conversation en voix et en vidéo ne coûte rien. Aucune API ni grille tarifaire n'a été annoncée pour les développeurs. Précision utile pour le public francophone: l'application vise d'abord le marché chinois, sans version française à ce jour.
- Regarde, écoute et parle en simultané, sans tour de parole
- Prend la parole de lui-même quand la scène change
- Suit plusieurs interlocuteurs dans une même pièce
- Accessible sans frais dans l'application Doubao
- Réservé à Doubao, aucune API pour les développeurs
- Inscription compliquée sans numéro de téléphone chinois
- Encore jeune: ni rapport technique ni chiffres détaillés publiés
Un seul cerveau au lieu de trois modules enchaînés
SeedRealtime fusionne audio, vidéo et texte dans une seule architecture de bout en bout, là où la plupart des assistants vocaux par IA enchaînent reconnaissance vocale, modèle de langage puis synthèse de la voix, avec de la latence et des pertes de contexte à chaque passage de relais. La décision de parler ou de se taire se prend à l'intérieur du modèle, sans détecteur d'activité vocale externe.
Le résultat se mesure au rythme de la conversation. Selon l'évaluation humaine de ByteDance, les problèmes de tempo, réponses coupées, silences trop longs, déclenchements sur une voix voisine, ont été divisés par deux face aux systèmes en cascade. Le principe du full-duplex) appliqué à l'IA, en somme: les deux parties peuvent parler en même temps, comme au téléphone.
SeedRealtime en situation: dîner bruyant, musée, machine à café
ByteDance a publié plusieurs scénarios où le modèle exploite ce qu'il voit et entend en continu. Vous tournez les pages d'un document devant la caméra, il vous arrête au chapitre demandé. Le plus marquant reste sa capacité à relier chaque voix à un visage dans un groupe.
| Situation | Ce que fait SeedRealtime |
|---|---|
| Dîner de groupe bruyant | Associe noms, visages et voix, attribue chaque avis au bon interlocuteur |
| Visite de musée | Signale de lui-même l'apparition de l'objet que vous cherchiez |
| Machine à café inconnue | Guide les manipulations et corrige selon ce qu'il voit |
| Restaurant à l'étranger | Aide à comprendre le menu et les explications du serveur en direct |
| Lecture d'un document | Repère la bonne page au fil de votre feuilletage |
Doubao, seul guichet pour essayer SeedRealtime
Le modèle est déployé dans Doubao, via la fonction d'appel de l'application, en voix comme en vidéo, sans rien payer. Revers de la médaille: l'inscription réclame en général un numéro de mobile chinois (+86), un vrai obstacle depuis la France, et l'interface n'existe pas en français.
Côté développeurs, patience. Pas de point d'accès Volcano Engine ou BytePlus, pas de poids ouverts, pas de rapport technique (ByteDance garde ses secrets, pour l'instant). La feuille de route annonce une latence réduite, un meilleur suivi des interlocuteurs et des tâches outillées comme les recherches ou les réservations.
Questions fréquentes
SeedRealtime est-il gratuit ?
Oui, SeedRealtime s'utilise sans frais dans l'application Doubao de ByteDance, en conversation vocale et vidéo. Aucune formule payante, aucun quota chiffré ni aucune API facturée n'ont été annoncés. L'accès passe uniquement par l'application grand public, ce qui suppose un compte Doubao valide.
Peut-on utiliser SeedRealtime en France ?
Difficilement pour le moment. Doubao demande le plus souvent un numéro de mobile chinois (+86) à l'inscription, et l'interface est en chinois, sans version française annoncée. Depuis la France, le modèle s'observe surtout à travers les démonstrations publiées par l'équipe Seed de ByteDance.
Existe-t-il une API SeedRealtime pour les développeurs ?
Non. ByteDance n'a publié ni point d'accès Volcano Engine ou BytePlus, ni poids ouverts, ni rapport technique pour ce modèle. Une équipe tierce ne peut donc pas l'intégrer aujourd'hui. La feuille de route évoque des évolutions, mais sans calendrier d'ouverture aux développeurs.
Quelle différence entre SeedRealtime et le mode vocal de ChatGPT ?
La vidéo native. SeedRealtime fusionne audio, image et texte dans un même modèle full-duplex, capable de commenter ce qu'il voit pendant que vous parlez et de prendre l'initiative. OpenAI et Google poussent des capacités temps réel proches, mais ByteDance revendique cette fusion audio-visuelle de bout en bout comme sa marque de fabrique.
Verdict : Deux fois moins de coupures et de faux départs, à en croire ByteDance: les curieux d'interfaces vocales et les équipes qui conçoivent des assistants caméra-micro y liront la direction que prend la conversation homme-machine, et les habitués de Doubao peuvent déjà lui parler sans sortir la carte bancaire.
