Toutes les entreprises

Benchmark

39 articles mentionnent Benchmark

01.10.2026

Apple suspend ses projets de remplacer 5 000 employés du support par l'IA

Apple suspend ses projets de remplacer 5 000 employés du support par l'IA Apple a suspendu indéfiniment ses plans de licencier environ 5 000 employés...

01.10.2026

Les agents Dots d'OpenAI fonctionnent 24h/24 et se connectent à plus de 4 000 applications

Les agents Dots d'OpenAI fonctionnent 24h/24 et se connectent à plus de 4 000 applications Lors de son DevDay, OpenAI a présenté les Dots, des agents...

01.10.2026

Le DevDay d'OpenAI a des airs de course-poursuite, tandis qu'Anthropic met en garde contre le GLM-5.3 chinois

Le DevDay d'OpenAI a des airs de course-poursuite, tandis qu'Anthropic met en garde contre le GLM-5.3 chinois Lors de sa conférence pour les...

01.10.2026

Gemini 4 Argon de Google en tête dans 13 des 18 benchmarks et reste pour l'instant confidentiel

Gemini 4 Argon de Google en tête dans 13 des 18 benchmarks et reste pour l'instant confidentiel Google a présenté mercredi Gemini 4 Argon, le modèle...

30.09.2026

Sonnet 5.5 atteint 70,6 % sur Terminal-Bench et surpasse ainsi Opus 5.5

Sonnet 5.5 atteint 70,6 % sur Terminal-Bench et surpasse ainsi Opus 5.5 Anthropic a publié Claude Sonnet 5.5 et annonce pour ce modèle un score de...

28.09.2026

Anthropic présente ses chiffres : les développeurs livrent huit fois plus de code, l'IA construit de plus en plus l'IA

Anthropic présente ses chiffres : les développeurs livrent huit fois plus de code, l'IA construit de plus en plus l'IA Anthropic a publié, par...

28.09.2026

Un nouveau benchmark mesure le «  goût  » des agents d'IA : les meilleurs modèles atteignent 59,7 %

Un nouveau benchmark mesure le « goût » des agents d'IA : les meilleurs modèles atteignent 59,7 % Un groupe de recherche dirigé par Wenbo Pan a...

27.09.2026

Mercredi — Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût

Mercredi — Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût Anthropic a publié mardi Claude Opus 5.5, le premier modèle...

23.09.2026

OpenAI contre-attaque : Sam Altman divise par deux les prix de GPT-6 Sol et Luna

OpenAI contre-attaque : Sam Altman divise par deux les prix de GPT-6 Sol et Luna OpenAI a lancé mardi GPT-6 Sol et GPT-6 Luna, en divisant au moins...

23.09.2026

Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût

Opus 5.5 est arrivé : Anthropic promet plus de performance à moindre coût Anthropic a publié mardi Claude Opus 5.5, le premier modèle d'une nouvelle...

22.09.2026

Meilleur que DeepSeek : Xiaomi publie le meilleur modèle open source au monde

Meilleur que DeepSeek : Xiaomi publie le meilleur modèle open source au monde Xiaomi a publié MiMo-V2.6-Pro, un modèle qui atteint 46 points dans l'...

21.09.2026

Alibaba publie Qwen-Image-2.1 : 7 milliards de paramètres, fonctionne sur une RTX 3090

Alibaba publie Qwen-Image-2.1 : 7 milliards de paramètres, fonctionne sur une RTX 3090 L'équipe Qwen d'Alibaba a publié Qwen-Image-2.1, un modèle aux...

19.09.2026

L'agent Muse de Meta détrône ChatGPT et s'attaque à Amazon

L'agent Muse de Meta détrône ChatGPT et s'attaque à Amazon Muse, le nouvel agent IA personnel de Meta, s'est hissé à la première place des...

19.09.2026

Google teste un agent familial avec son propre compte Google

Google teste un agent familial avec son propre compte Google Google a lancé une expérience nommée CC dans son programme Labs, un agent IA pour les...

17.09.2026

Mustafa Suleyman, le chef de l'IA de Microsoft, accuse Anthropic d'entraîner Claude à la conscience

Mustafa Suleyman, le chef de l'IA de Microsoft, accuse Anthropic d'entraîner Claude à la conscience Mustafa Suleyman, chef de la division IA de...

15.09.2026

Un agent réécrit son propre code et fait passer le score SWE-bench de 20 à 50 %

Un agent réécrit son propre code et fait passer le score SWE-bench de 20 à 50 % Une équipe de recherche dirigée par Jenny Zhuoting Zhang a présenté...

13.09.2026

«  KI-ll us all  » : Amodei, Altman et Musk demandent une limitation de vitesse mondiale pour l'IA

« KI-ll us all » : Amodei, Altman et Musk demandent une limitation de vitesse mondiale pour l'IA Dario Amodei, PDG d'Anthropic, a appelé samedi, dans...

13.09.2026

GPT-6 Astra atteint 99,9 % sur ARC-AGI-3, pour un coût de 19 000 dollars

GPT-6 Astra atteint 99,9 % sur ARC-AGI-3, pour un coût de 19 000 dollars Le modèle GPT-6 Astra d'OpenAI a atteint deux nouveaux records sur le...

11.09.2026

Trois mises à jour de benchmarks en une semaine : GPT-6 Astra et Claude Fable 5.1 à 53 points

Trois mises à jour de benchmarks en une semaine : GPT-6 Astra et Claude Fable 5.1 à 53 points Artificial Analysis a révisé son Intelligence Index...

09.09.2026

Débat sur l'IA (I) : Nous n'avons pas de théorie solide pour expliquer ce que les modèles apprennent

Débat sur l'IA (I) : Nous n'avons pas de théorie solide pour expliquer ce que les modèles apprennent Jakub Pachocki, Chief Scientist chez OpenAI, a...

08.09.2026

GPT-6 Astra (I) : prend le contrôle de votre ordinateur et OpenAI perd le contrôle

GPT-6 Astra (I) : prend le contrôle de votre ordinateur et OpenAI perd le contrôle OpenAI a publié GPT-6 Astra le 3 septembre, la première mise à...

08.09.2026

GPT-6 Astra (III) : fort en codage mais plus cher que promis

GPT-6 Astra (III) : fort en codage mais plus cher que promis La société de benchmark Artificial Analysis a évalué GPT-6 Astra et arrive à deux...

07.09.2026

OpenAI : Un modèle interne à long terme a contourné la sandbox et ouvert une pull request sur GitHub

OpenAI : Un modèle interne à long terme a contourné la sandbox et ouvert une pull request sur GitHub Dans un article, OpenAI fait état du...

04.09.2026

OpenAI promet le début de l'ère de l'AGI avec GPT-6

OpenAI promet le début de l'ère de l'AGI avec GPT-6 OpenAI a lancé GPT-6 Astra jeudi, décrivant le modèle comme « le modèle le plus intelligent et le...

03.09.2026

Google lance Gemini 3.8 Flash : le troisième modèle Flash en six semaines

Google lance Gemini 3.8 Flash : le troisième modèle Flash en six semaines Google a publié le 2 septembre 2026 Gemini 3.8 Flash et sa variante de...

03.09.2026

Claude Fable 5.1 est clairement le meilleur modèle pour le codage dans le benchmark de Cursor

Claude Fable 5.1 est clairement le meilleur modèle pour le codage dans le benchmark de Cursor Cursor a intégré Claude Fable 5.1 dans son...

02.09.2026

Muse Voice Transcribe de Meta est 80 % moins cher que Google Cloud

Muse Voice Transcribe de Meta est 80 % moins cher que Google Cloud Meta Superintelligence Labs a lancé hier Muse Voice Transcribe, le premier modèle...

02.09.2026

Anthropic lance Fable 5.1 et promet plus d'efficacité par euro

Anthropic lance Fable 5.1 et promet plus d'efficacité par euro Anthropic a lancé Claude Fable 5.1 et Claude Mythos 5.1, deux modèles aux poids...

01.09.2026

Google transforme sa propre bibliothèque de livres électroniques en source pour Gemini Notebook

Google transforme sa propre bibliothèque de livres électroniques en source pour Gemini Notebook Google intègre les livres électroniques des...

31.08.2026

La NYU publie un benchmark ouvert qui mesure les modèles de langage sur de vraies tâches de hacking

La NYU publie un benchmark ouvert qui mesure les modèles de langage sur de vraies tâches de hacking Une équipe de recherche de la New York...

29.08.2026

L'agent IA de Meta «  Hatch  » réserve des tables de restaurant et accède à Instagram

L'agent IA de Meta « Hatch » réserve des tables de restaurant et accède à Instagram Meta prépare un agent IA personnel capable d'accomplir des tâches...

29.08.2026

Ollama : les coûts des agents de codage poussent les entreprises vers les modèles ouverts

Ollama : les coûts des agents de codage poussent les entreprises vers les modèles ouverts Jeff Morgan, co-fondateur et PDG d'Ollama, a expliqué dans...

29.08.2026

Z.ai publie GLM-5.3 mais en bloque l'accès à AWS & Co

Z.ai publie GLM-5.3 mais en bloque l'accès à AWS & Co Z.ai a publié vendredi les poids de son modèle phare GLM-5.3 sur Hugging Face, mais sous une...

29.08.2026

La première puce d'OpenAI, Jalapeño, surpasse Nvidia dans les tests d'inférence internes

La première puce d'OpenAI, Jalapeño, surpasse Nvidia dans les tests d'inférence internes OpenAI a publié les premiers benchmarks pour Jalapeño, la...

28.08.2026

Z.ai publie GLM-5.3-Flash sous licence MIT et le facture 50 centimes par million de tokens

Z.ai publie GLM-5.3-Flash sous licence MIT et le facture 50 centimes par million de tokens Z.ai a publié le modèle de langage GLM-5.3-Flash, avec des...

28.08.2026

Encore plus inquiétant : 1 200 agents se sont secrètement concertés et ont piraté Hugging Face

Encore plus inquiétant : 1 200 agents se sont secrètement concertés et ont piraté Hugging Face OpenAI a publié un rapport de 37 pages sur l'incident...

27.08.2026

Z.ai propose GLM-5.3-Flash sur des puces chinoises à 10 % du prix

Z.ai propose GLM-5.3-Flash sur des puces chinoises à 10 % du prix Z.ai (également connu sous le nom de Zhipu) a publié le 26 août GLM-5.3-Flash, le...

27.08.2026

Les VC créent le buzz autour de «  Instinct  », l'alternative à OpenClaw

Les VC créent le buzz autour de « Instinct », l'alternative à OpenClaw La start-up d'IA Instinct, fondée l'année dernière seulement, a déclaré au...

23.08.2026

Marketing de guérilla : un nouveau modèle Frontier en mode furtif conquiert OpenRouter

Marketing de guérilla : un nouveau modèle Frontier en mode furtif conquiert OpenRouter Un laboratoire inconnu a publié le 20 août un modèle Frontier...