Aller au contenu

Google Gemini Ultra vs ChatGPT + GPT4 - Comparatif complet

Rédigé par Gab

Sommaire

Google a annoncé mercredi le déploiement de Gemini, son nouveau modèle d’intelligence artificielle (IA) générative, capable de comprendre et de réagir au monde qui l’entoure sans être sollicité. Ce modèle multimédia, qui combine la parole, la vision et le raisonnement, doit permettre à Google de concurrencer ChatGPT, l’IA d’OpenAI qui a révolutionné le secteur.

gemini vs gpt4

Les annonces de Google

  • https://twitter.com/8teAPi/status/1732501398326296652
  • https://storage.googleapis.com/deepmind-media/gemini/gemini_1_report.pdf
  • 3 nouveaux modèles
    • Gemini Ultra → Catégorie GPT4 (et supérieur d’après les tests)
      • Annoncé pour début d’année 2024
    • Gemini Pro → Catégorie GPT3.5, optimisée en termes de coût / rapidité
      • Supérieur à GPT3.5 dans la quasi totalité des tests
      • Disponible dès aujourd’hui sur Bard (mais pas encore en Europe…)
    • Gemini Nano → Très petit modèle, 1.8 & 3.25 milliards de params, destiné à être utilisé sur les appareils Google (Google Pixel par exemple), donc disponible sans connexion
  • Performances (Focus sur Gemini Ultra)
    • Annoncé meilleur que GPT4 dans la résolution de problème (Maths, Taches multiples, codes, traductions, etc)

    • Sur un visuel, on à un problème de méthodologie

      • L’image montre que GPT4 à été évalué via 5-shot & Gemini via COT@32, ce qui veut dire que : GPT-4 avait 5 essais pour obtenir la réponse, et devait le faire en une seule fois
      • Gemini avait 32 essais, et utilisait la pensée en chaîne (raisonnement intermédiaire) pour parvenir à la réponse
    • Dans le paper, sur du COT@32, le résultat de GPT4 est sensiblement meilleur, mais toujours + faible que Gemini Ultra (87.29% vs 90.04%)

    • Donc : Gemini Ultra v1 est annoncé meilleur que le GPT4 actuel, de peu, mais meilleur : Chaque % à ce niveau de performances est très complexe à atteindre

  • Annoncé comme “nativement mutlimodal”
    • Un pique à OpenAI : Until now, the standard approach to creating multimodal models involved training separate components for different modalities and then stitching them together to roughly mimic some of this functionality → Jusqu'à présent, l'approche standard pour créer des modèles multimodaux consistait à entraîner des composants séparés pour différentes modalités, puis à les assembler pour imiter approximativement certaines de ces fonctionnalités
      • ChatGPT →← API de GPT-Vision par exemple
    • Entrainé sur du code, des audios, des images et des vidéos
    • Analyse d’images / vidéos → Annoncé meilleur que GPT4-V
    • Une vidéo démo assez incroyable d’une application qui intègre Gemini Ultra est disponible, donc analyse + comparaison avec GPT4 : https://twitter.com/sundarpichai/status/1732433036929589301
      • 1:26 → Il montre un canard en plastique & demande à Gemini de lui expliquer comme le prononcer en Mandarin → Gemini génère un audio (Possible via l’app ChatGPT, mais pas optimisé pour)
      • 2:11 → Jeu qui vise à deviner un pays → Gemini génère 3 icones → Le testeur pose son doigt sur l’Australie → Gemini analyse et valide le résultat (Possible également via l’app ChatGPT, on est sur génération d’images + analyse d’image)
      • 2:32 → Deuxième jeu, Gemini doit deviner dans quel verre se trouve le papier (Démo la + impressionnante, c’est actuellement impossible via ChatGPT & GPT-Vision)
      • 3:54 → Génération d’une image à partir de 2 objets + prompts (Analyse d’image + prompt classique, très interessant, 100% possible via ChatGPT mais pas optimisé pour)
      • 4:22 → La démo la + incroyable d’après la commu X (ChatGPT n’y arrive pas d’après mes tests)
      • 4:37 → Comparaison de l’aérodynamique de 2 voitures (ChatGPT n’y arrive pas d’après mes tests)
      • 4:59 → Il analyse une guitare, génère un son, analyse ensuite l’ajout d’une partie “électrique” à la guitare & génère (?) un son différent (Impossible via ChatGPT)
      • Reste de la vidéo c’est focus analyse de vidéo, ce que ne propose pas ChatGPT
  • Conclusion multimodal : Les fonctionnalités annoncées sont très interessantes, mais attention par contre à la différence avec ce qu’on aura réellement & le prix → Le modèle doit être très gourmand en ressources

Gemini Ultra : Pourquoi parler de concurrent à GPT5 ?

  • Côté perf → Chaque % est extrêmement compliqué à atteindre, donc GPT5 sera égal ou très légèrement supérieur
  • OpenAI à confirmer le développement de GPT5, donc tentera de doubler Google Gemini Ultra
  • GPT5 devrait lui aussi intégrer une partie multimodale native (ou ils continueront avec la stratégie actuelle, qui peut être aussi intéressante)

Google Gemini Pro sur Bard, des premiers retours très intéressants

Les exemples multimodaux présents dans le Paper + une comparaison avec le ChatGPT qu’on a actuellement

  • Les exemples sont présents dans le paper de Gemini - Que ce qu’un paper ? C’est le PDF de présentation du modèle
  • Pourquoi le ChatGPT “actuel” → Gemini Ultra et annoncé pour le début de l’année 2024, ChatGPT peut donc s’améliorer d’ici la
  1. Compréhension de graphique + raisonnement
  2. Génération d’un article de blog, avec image + texte
  3. Test de QI
  4. Geogessing (Deviner la localisation d’une photo) → Incroyable, mais..
  5. Devoir de géométrie
  6. Exercice de physique
  7. Analyse d’un arbre généalogique + déduction
  8. Raisonnement
  9. Graph 2 Code (Incroyable)
  10. Problème de maths + complexe

Un accueil mitigé

Conclusion

  • Gemini Ultra est très légèrement meilleur que GPT4, mais disponible en début d’année prochaine & entrainé comme multimodal, les exemples sont impressionnants