Aller au contenu

Gemini 2.0 révolutionne la génération et l’édition d’images d’IA avec sa nouvelle fonction native

Depuis plus d’un an, le terme nativement multimodal a résonné dans le monde de l’intelligence artificielle, mais peu ont réussi à tirer pleinement parti de ces capacités.

Par

Mis à jour le 3 min de lecture

Gemini 2.0 révolutionne la génération et l’édition d’images d’IA avec sa nouvelle fonction native

Les IA de ce guide

Depuis plus d’un an, le terme nativement multimodal a résonné dans le monde de l’intelligence artificielle, mais peu ont réussi à tirer pleinement parti de ces capacités. Maintenant, Google a fait son coup avec le lancement de son modèle le plus récent, Gemini 2.0 Flash Experimental, qui permet non seulement de générer des images, mais aussi de les éditer de manière native. Allez, il a donné un petit coup de pouce à Photoshop 🤏🏼…

Pourquoi la génération d’images est-elle si importante ? Bien que la génération d’images par IA soit disponible via des chatbots comme ChatGPT, ceux-ci dépendent souvent de modèles spécialisés comme Dall-E 3 ou Imagen 3, qui sont des extensions du modèle principal et non pas une partie intégrante de celui-ci. En revanche, des modèles comme Gemini sont nativement multimodaux, ce qui signifie qu’ils peuvent comprendre et créer à la fois du texte et des images de manière intrinsèque.

Génération d’Images Natives avec Gemini 2.0 Flash Experimental

Actuellement, cette fonction de génération d’images natives n’est pas disponible pour tous les utilisateurs. Le modèle Gemini 2.0 Flash Experimental peut être testé gratuitement sur le AI Studio de Google et sera bientôt disponible pour un public plus large. Après avoir expérimenté avec ce modèle, je peux dire que l’expérience a été vraiment surprenante.

J’ai commencé par demander à Gemini de créer un guide visuel sur comment faire des macaronis à la bolognaise. Les résultats étaient surprenants, montrant une cohérence remarquable entre les images générées, de la poêle aux ingrédients. Chaque image maintient la même résolution de 1024 x 680, ce qui facilite la création de guides visuels sur n’importe quel sujet.

Interface de Google AI Studio avec Gemini 2.0 Flash : une recette de pâtes bolognaises illustrée étape par étape par des images générées
Interface de Google AI Studio avec Gemini 2.0 Flash : une recette de pâtes bolognaises illustrée étape par étape par des images générées

Ensuite, j’ai demandé à Gemini de générer une pièce vide, et je lui ai demandé des modifications sur la décoration et l’utilité de la pièce. La continuité qu’il a maintenue était incroyable.

Conversation avec une IA générative : à partir des consignes de l'utilisateur, une pièce vide devient une chambre d'enfant meublée en trois images
Conversation avec une IA générative : à partir des consignes de l'utilisateur, une pièce vide devient une chambre d'enfant meublée en trois images

Édition d’Images Natives avec Gemini 2.0 Flash Experimental

Pour démontrer la fonction d’édition d’images, j’ai téléchargé une photo de mon garage et lui ai demandé de changer ma voiture pour une Tesla blanche, et le résultat était impressionnant. Enfin, je lui ai demandé d’ajouter des tables avec des ordinateurs, et ainsi il m’a montré le potentiel de l’édition d’images grâce à la capacité multimodale native de Gemini. Ce n’étaient pas parfaites, mais elles étaient très bonnes. De plus, j’ai demandé à Gemini de coloriser une vieille photo en noir et blanc, et le résultat a dépassé mes attentes, avec une qualité visuelle optimale et sans erreurs visibles.

Les possibilités avec Gemini sont vastes et passionnantes. Google a fait un travail admirable en intégrant la génération et l’édition d’images de manière native. Avec le récent lancement de Veo 2 pour la génération de vidéos et Imagen 3 pour la génération d’images spécialisées, il semble que Google ait dépassé OpenAI sur plusieurs aspects, pas seulement en génération de texte. Il sera intéressant de voir comment OpenAI répond à cette avancée avec son ChatGPT.

Informaticien depuis 2002 : systèmes, ingénierie, développement web et SEO. Je fais des affaires avec l’IA depuis février 2023, quand ChatGPT a pu s’acheter en Espagne.

Plus sur moi Comment je teste les outils

Guides liés

Une question après la lecture ? Posez-la-moi

C’est moi, Miguel Ángel, qui vous réponds, ici même. Et si quelque chose n’est plus à jour, dites-le-moi et je corrige.

Écrire ma question

Ce que vous voulez me demander ou me raconter. Pas de liens.

Celui que vous voulez voir publié. Pas d’e-mail.

Ce que je garde : votre nom affiché, votre texte et la date, pour les publier après relecture. Je ne vous demande pas d’e-mail. Contre le spam, Cloudflare Turnstile vérifie que vous êtes humain et je garde pendant 30 jours une empreinte de votre connexion calculée avec une clé, impossible à inverser (jamais l’IP en clair). Ce qui n’est pas publié est supprimé 30 jours après relecture ; ce qui est publié reste tant que la page existe ou jusqu’à ce que vous me demandiez de le retirer. Base légale : votre consentement, retirable à tout moment. Politique de confidentialité.

Je les lis tous avant publication. Pas de liens ni d’insultes.