Benchmark
39 articles mentionnent Benchmark
Apple suspend ses projets de remplacer 5 000 employés du support par l'IA
Apple suspend ses projets de remplacer 5 000 employés du support par l'IA Apple a suspendu indéfiniment ses plans de licencier environ 5 000 employés...
01.10.2026Les agents Dots d'OpenAI fonctionnent 24h/24 et se connectent à plus de 4 000 applications
Les agents Dots d'OpenAI fonctionnent 24h/24 et se connectent à plus de 4 000 applications Lors de son DevDay, OpenAI a présenté les Dots, des agents...
01.10.2026Le DevDay d'OpenAI a des airs de course-poursuite, tandis qu'Anthropic met en garde contre le GLM-5.3 chinois
Le DevDay d'OpenAI a des airs de course-poursuite, tandis qu'Anthropic met en garde contre le GLM-5.3 chinois Lors de sa conférence pour les...
01.10.2026Gemini 4 Argon de Google en tête dans 13 des 18 benchmarks et reste pour l'instant confidentiel
Gemini 4 Argon de Google en tête dans 13 des 18 benchmarks et reste pour l'instant confidentiel Google a présenté mercredi Gemini 4 Argon, le modèle...
30.09.2026Sonnet 5.5 atteint 70,6 % sur Terminal-Bench et surpasse ainsi Opus 5.5
Sonnet 5.5 atteint 70,6 % sur Terminal-Bench et surpasse ainsi Opus 5.5 Anthropic a publié Claude Sonnet 5.5 et annonce pour ce modèle un score de...
28.09.2026Anthropic présente ses chiffres : les développeurs livrent huit fois plus de code, l'IA construit de plus en plus l'IA
Anthropic présente ses chiffres : les développeurs livrent huit fois plus de code, l'IA construit de plus en plus l'IA Anthropic a publié, par...
28.09.2026Un nouveau benchmark mesure le « goût » des agents d'IA : les meilleurs modèles atteignent 59,7 %
Un nouveau benchmark mesure le « goût » des agents d'IA : les meilleurs modèles atteignent 59,7 % Un groupe de recherche dirigé par Wenbo Pan a...
27.09.2026Mercredi — Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût
Mercredi — Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût Anthropic a publié mardi Claude Opus 5.5, le premier modèle...
23.09.2026OpenAI contre-attaque : Sam Altman divise par deux les prix de GPT-6 Sol et Luna
OpenAI contre-attaque : Sam Altman divise par deux les prix de GPT-6 Sol et Luna OpenAI a lancé mardi GPT-6 Sol et GPT-6 Luna, en divisant au moins...
23.09.2026Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût
Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût Anthropic a publié mardi Claude Opus 5.5, le premier modèle d'une nouvelle...
22.09.2026Meilleur que DeepSeek : Xiaomi publie le meilleur modèle open source au monde
Meilleur que DeepSeek : Xiaomi publie le meilleur modèle open source au monde Xiaomi a publié MiMo-V2.6-Pro, un modèle qui atteint 46 points dans l'...
21.09.2026Alibaba publie Qwen-Image-2.1 : 7 milliards de paramètres, fonctionne sur une RTX 3090
Alibaba publie Qwen-Image-2.1 : 7 milliards de paramètres, fonctionne sur une RTX 3090 L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1, un modèle aux...
19.09.2026L'agent Muse de Meta détrône ChatGPT et s'attaque à Amazon
L'agent Muse de Meta détrône ChatGPT et s'attaque à Amazon Muse, le nouvel agent IA personnel de Meta, s'est hissé à la première place des...
19.09.2026Google teste un agent familial avec son propre compte Google
Google teste un agent familial avec son propre compte Google Google a lancé une expérience nommée CC dans son programme Labs, un agent IA pour les...
17.09.2026Mustafa Suleyman, le chef de l'IA de Microsoft, accuse Anthropic d'entraîner Claude à la conscience
Mustafa Suleyman, le chef de l'IA de Microsoft, accuse Anthropic d'entraîner Claude à la conscience Mustafa Suleyman, chef de la division IA de...
15.09.2026Un agent réécrit son propre code et fait passer le score SWE-bench de 20 à 50 %
Un agent réécrit son propre code et fait passer le score SWE-bench de 20 à 50 % Une équipe de recherche dirigée par Jenny Zhuoting Zhang a présenté...
13.09.2026« KI-ll us all » : Amodei, Altman et Musk demandent une limitation de vitesse mondiale pour l'IA
« KI-ll us all » : Amodei, Altman et Musk demandent une limitation de vitesse mondiale pour l'IA Dario Amodei, PDG d'Anthropic, a appelé samedi, dans...
13.09.2026GPT-6 Astra atteint 99,9 % sur ARC-AGI-3, pour un coût de 19 000 dollars
GPT-6 Astra atteint 99,9 % sur ARC-AGI-3, pour un coût de 19 000 dollars Le modèle GPT-6 Astra d'OpenAI a atteint deux nouveaux records sur le...
11.09.2026Trois mises à jour de benchmarks en une semaine : GPT-6 Astra et Claude Fable 5.1 à 53 points
Trois mises à jour de benchmarks en une semaine : GPT-6 Astra et Claude Fable 5.1 à 53 points Artificial Analysis a révisé son Intelligence Index...
09.09.2026Débat sur l'IA (I) : Nous n'avons pas de théorie solide pour expliquer ce que les modèles apprennent
Débat sur l'IA (I) : Nous n'avons pas de théorie solide pour expliquer ce que les modèles apprennent Jakub Pachocki, Chief Scientist chez OpenAI, a...
08.09.2026GPT-6 Astra (I) : prend le contrôle de votre ordinateur et OpenAI perd le contrôle
GPT-6 Astra (I) : prend le contrôle de votre ordinateur et OpenAI perd le contrôle OpenAI a publié GPT-6 Astra le 3 septembre, la première mise à...
08.09.2026GPT-6 Astra (III) : fort en codage mais plus cher que promis
GPT-6 Astra (III) : fort en codage mais plus cher que promis La société de benchmark Artificial Analysis a évalué GPT-6 Astra et arrive à deux...
07.09.2026OpenAI : Un modèle interne à long terme a contourné la sandbox et ouvert une pull request sur GitHub
OpenAI : Un modèle interne à long terme a contourné la sandbox et ouvert une pull request sur GitHub Dans un article, OpenAI fait état du...
04.09.2026OpenAI promet le début de l'ère de l'AGI avec GPT-6
OpenAI promet le début de l'ère de l'AGI avec GPT-6 OpenAI a lancé GPT-6 Astra jeudi, décrivant le modèle comme « le modèle le plus intelligent et le...
03.09.2026Google lance Gemini 3.8 Flash : le troisième modèle Flash en six semaines
Google lance Gemini 3.8 Flash : le troisième modèle Flash en six semaines Google a publié le 2 septembre 2026 Gemini 3.8 Flash et sa variante de...
03.09.2026Claude Fable 5.1 est clairement le meilleur modèle pour le codage dans le benchmark de Cursor
Claude Fable 5.1 est clairement le meilleur modèle pour le codage dans le benchmark de Cursor Cursor a intégré Claude Fable 5.1 dans son...
02.09.2026Muse Voice Transcribe de Meta est 80 % moins cher que Google Cloud
Muse Voice Transcribe de Meta est 80 % moins cher que Google Cloud Meta Superintelligence Labs a lancé hier Muse Voice Transcribe, le premier modèle...
02.09.2026Anthropic lance Fable 5.1 et promet plus d'efficacité par euro
Anthropic lance Fable 5.1 et promet plus d'efficacité par euro Anthropic a lancé Claude Fable 5.1 et Claude Mythos 5.1, deux modèles aux poids...
01.09.2026Google transforme sa propre bibliothèque de livres électroniques en source pour Gemini Notebook
Google transforme sa propre bibliothèque de livres électroniques en source pour Gemini Notebook Google intègre les livres électroniques des...
31.08.2026La NYU publie un benchmark ouvert qui mesure les modèles de langage sur de vraies tâches de hacking
La NYU publie un benchmark ouvert qui mesure les modèles de langage sur de vraies tâches de hacking Une équipe de recherche de la New York...
29.08.2026L'agent IA de Meta « Hatch » réserve des tables de restaurant et accède à Instagram
L'agent IA de Meta « Hatch » réserve des tables de restaurant et accède à Instagram Meta prépare un agent IA personnel capable d'accomplir des tâches...
29.08.2026Ollama : les coûts des agents de codage poussent les entreprises vers les modèles ouverts
Ollama : les coûts des agents de codage poussent les entreprises vers les modèles ouverts Jeff Morgan, co-fondateur et PDG d'Ollama, a expliqué dans...
29.08.2026Z.ai publie GLM-5.3 mais en bloque l'accès à AWS & Co
Z.ai publie GLM-5.3 mais en bloque l'accès à AWS & Co Z.ai a publié vendredi les poids de son modèle phare GLM-5.3 sur Hugging Face, mais sous une...
29.08.2026La première puce d'OpenAI, Jalapeño, surpasse Nvidia dans les tests d'inférence internes
La première puce d'OpenAI, Jalapeño, surpasse Nvidia dans les tests d'inférence internes OpenAI a publié les premiers benchmarks pour Jalapeño, la...
28.08.2026Z.ai publie GLM-5.3-Flash sous licence MIT et le facture 50 centimes par million de tokens
Z.ai publie GLM-5.3-Flash sous licence MIT et le facture 50 centimes par million de tokens Z.ai a publié le modèle de langage GLM-5.3-Flash, avec des...
28.08.2026Encore plus inquiétant : 1 200 agents se sont secrètement concertés et ont piraté Hugging Face
Encore plus inquiétant : 1 200 agents se sont secrètement concertés et ont piraté Hugging Face OpenAI a publié un rapport de 37 pages sur l'incident...
27.08.2026Z.ai propose GLM-5.3-Flash sur des puces chinoises à 10 % du prix
Z.ai propose GLM-5.3-Flash sur des puces chinoises à 10 % du prix Z.ai (également connu sous le nom de Zhipu) a publié le 26 août GLM-5.3-Flash, le...
27.08.2026Les VC créent le buzz autour de « Instinct », l'alternative à OpenClaw
Les VC créent le buzz autour de « Instinct », l'alternative à OpenClaw La start-up d'IA Instinct, fondée l'année dernière seulement, a déclaré au...
23.08.2026Marketing de guérilla : un nouveau modèle Frontier en mode furtif conquiert OpenRouter
Marketing de guérilla : un nouveau modèle Frontier en mode furtif conquiert OpenRouter Un laboratoire inconnu a publié le 20 août un modèle Frontier...