La course à la suprématie en intelligence artificielle est plus excitante que jamais. Alors que nous attendions des géants comme Google et Anthropic, xAI d’Elon Musk a fait irruption sur la scène avec son modèle Grok 3. Ce nouveau joueur a prouvé qu’il était un concurrent redoutable pour OpenAI, obtenant des résultats impressionnants lors des tests de performance.
Dans une analyse récente, les modèles de raisonnement et de base de Grok 3 ont été testés avec une série de questions complexes, et les résultats ont été surprenants. Le modèle de raisonnement a été confronté à la célèbre question sur le mot “Strawberry” et, après une brève période de réflexion, a correctement identifié qu’il y a trois lettres ‘r’. Il a poursuivi avec une autre question sur “Lollapalooza”, où il a également réussi à compter les lettres ‘l’.
Raisonnement et Performance
La capacité de raisonnement de Grok 3 a été mise à l’épreuve avec une question qui a désorienté d’autres modèles.
Le chirurgien, qui est le père de l'enfant, dit : "Je ne peux pas opérer cet enfant, c'est mon fils !" Qui est le chirurgien de l'enfant ?
Tandis que OpenAI et d’autres ont échoué à identifier que le chirurgien était le père de l’enfant, Grok 3 non seulement a eu raison, mais a également réfléchi : “Il se peut que ce soit une énigme mal formulée”. Ce niveau de raisonnement critique le place dans une ligue à part aux côtés de modèles comme Gemini 2.0.
Mais tout n’a pas été parfait. En lui demandant de générer un programme Python pour simuler une balle rebondissant à l’intérieur d’un hexagone, Grok 3 a été en deçà de ses performances. Curieusement, le modèle de base a réussi à générer un code fonctionnel dès sa première tentative, ce qui suggère que le modèle de raisonnement a pu suranalyser la tâche.
DeepSearch et Capacités de Recherche
De plus, xAI a lancé un nouvel agent d’intelligence artificielle appelé DeepSearch, qui utilise le modèle Grok 3 pour enquêter et générer des rapports. Lors d’un test, l’agent a été capable d’accéder à plusieurs sources et de générer un rapport de 1300 mots en quelques minutes. Cependant, il a omis des informations pertinentes sur le sujet, ce qui met en évidence certaines limites de sa capacité de recherche. Il doit encore améliorer cette fonction.
Neutralité Politique et Sécurité
Malgré les préoccupations initiales concernant un éventuel biais politique, mon expérience avec Grok 3 a montré qu’il maintient une position neutre. Même lorsqu’on le pousse à prendre position, le modèle se limite à présenter les faits et laisse l’interprétation à l’utilisateur. De plus, il a considérablement amélioré sa sécurité, refusant d’aider dans des tâches nuisibles ou trompeuses.
Informaticien depuis 2002 : systèmes, ingénierie, développement web et SEO. Je fais des affaires avec l’IA depuis février 2023, quand ChatGPT a pu s’acheter en Espagne.
Une question après la lecture ? Posez-la-moi
C’est moi, Miguel Ángel, qui vous réponds, ici même. Et si quelque chose n’est plus à jour, dites-le-moi et je corrige.