Pouvez-vous imaginer que votre téléphone comprenne exactement ce que vous voyez à l’écran et réponde instantanément à vos demandes ? Il semblerait qu’Apple ait concrétisé cette idée avec son nouveau système d’IA, ReALM. Cette avancée, qui fait suite à l’acquisition de DarwinAI, promet de changer la façon dont nous interagissons avec nos appareils.
La particularité de ReALM est qu’il transforme les informations visuelles de votre écran en texte, ce qui lui permet d’opérer sur des appareils sans avoir recours à une reconnaissance d’image complexe. Il peut donc « comprendre » ce que vous voyez et les tâches que vous effectuez en arrière-plan. Cela signifie-t-il la fin des interactions compliquées avec Siri ? Tout porte à croire que oui.
Par exemple, si vous trouvez une entreprise sur un site web et que vous souhaitez l’appeler, il vous suffira de dire à Siri « appeler cette entreprise » et Siri, grâce à ReALM, saura quel numéro composer.
Ce système améliore non seulement l’expérience de l’utilisateur en simplifiant les interactions, mais il pose également un jalon en surpassant les modèles précédents, tels que le GPT-4, dans un certain nombre de tâches, malgré un nombre réduit de paramètres. L’intégration de ReALM dans les futures mises à jour de Siri promet une expérience mains libres plus fluide. Apple ne s’arrête pas là : elle travaille également sur des projets tels que MM1, qui minimise la nécessité d’utiliser plusieurs commandes pour obtenir les résultats souhaités, et un manipulateur d’images IA.
S’agit-il donc de l’aube d’une nouvelle ère dans laquelle nos appareils nous « comprennent » réellement ? Tout porte à croire que oui, et ReALM est à l’avant-garde de cette révolution, promettant une interaction sans précédent entre l’utilisateur et la technologie.
Pourquoi ReALM est-il Plus Performant que GPT-4 ? Un Aperçu de l’Avenir de l’IA
Le monde de l’intelligence artificielle connaît une évolution fascinante avec ReALM, une création d’Apple qui défie les modèles précédents tels que GPT-4. Mais qu’est-ce qui rend ReALM si spécial ? Tout d’abord, sa capacité à comprendre l’intention de l’utilisateur dans des requêtes spécifiques à un domaine le distingue nettement des autres. Contrairement aux autres modèles qui ont besoin d’images pour traiter les informations à l’écran, ReALM le fait par le biais d’un encodage textuel, ce qui lui permet de « voir » ce qui est à l’écran sans avoir besoin d’un traitement d’image lourd.
Les chercheurs d’Apple ont démontré que ReALM ne se contente pas d’égaler, mais surpasse GPT-4 dans les tâches impliquant des informations à l’écran, même lorsque GPT-4 avait accès à des captures d’écran et que ReALM ne s’appuyait que sur du texte. Ce résultat est remarquable car ReALM fonctionne avec moins de paramètres que GPT-4, ce qui suggère une efficacité et une efficience supérieures.
In a research paper, Apple researchers introduced ReALM.
It’s a new AI system that can understand on-screen tasks, conversational context, and background processes.
Researchers said it ‘substantially outperformed’ GPT-4.
Read more: https://t.co/5YY5E0kbsk pic.twitter.com/6M8kQiVnKo
— Rowan Cheung (@rowancheung) April 3, 2024
En outre, il a été observé que plus le modèle ReALM est grand, plus il est performant, notamment en ce qui concerne la compréhension des informations à l’écran. Cela souligne l’importance d’optimiser les modèles d’IA pour des tâches spécifiques, plutôt que de simplement augmenter leur taille.
L’un des principaux avantages de ReALM est sa capacité à affiner les intentions de l’utilisateur en fonction de demandes spécifiques, ce qui lui permet de saisir les subtilités de ce qui est réellement recherché et d’y répondre de manière appropriée. Il est ainsi particulièrement compétent pour résoudre les requêtes spécifiques à un domaine, ce que les modèles généraux ont souvent du mal à faire.
La Promesse de ReALM : Au-delà des Limites Actuelles
Pour l’avenir, ReALM représente non seulement un bond en avant vers une interaction homme-machine plus intuitive, mais ouvre également de nouvelles perspectives en matière d’efficacité des applications sur appareil. L’accent mis sur la conversion des entités à l’écran en texte naturel facilite la résolution des références et des requêtes, ce qui permet une compréhension approfondie du contexte de l’utilisateur.
Cependant, il est important de noter que, malgré ses capacités impressionnantes, ReALM doit encore relever des défis, en particulier en ce qui concerne les requêtes complexes des utilisateurs qui nécessitent une compréhension détaillée des relations spatiales. Les chercheurs sont conscients de ces limites et continuent à travailler pour les surmonter, afin d’atteindre un niveau de compréhension et de réponse encore plus sophistiqué.
ReALM ouvre la voie à une nouvelle génération d’IA, capable d’interagir avec nous d’une manière que nous ne pouvions qu’imaginer auparavant. Alors qu’Apple continue d’innover et de repousser les limites du possible, nous ne pouvons qu’attendre avec impatience la suite de cette passionnante frontière technologique.
Informaticien depuis 2002 : systèmes, ingénierie, développement web et SEO. Je fais des affaires avec l’IA depuis février 2023, quand ChatGPT a pu s’acheter en Espagne.
Une question après la lecture ? Posez-la-moi
C’est moi, Miguel Ángel, qui vous réponds, ici même. Et si quelque chose n’est plus à jour, dites-le-moi et je corrige.