Benchmark
41 Artikel erwähnen Benchmark
Google: Gemini 4 ist besser als die Konkurrenz und bleibt besser noch in Mountain View
Google: Gemini 4 ist besser als die Konkurrenz und bleibt besser noch in Mountain View Google hat am Mittwoch Gemini 4 Argon vorgestellt, das lange...
02.10.2026Cloudflare kontert Jev mit zwei offenen Clef-Modellen, zwei Wochen nach dessen Start
Cloudflare kontert Jev mit zwei offenen Clef-Modellen, zwei Wochen nach dessen Start Cloudflare hat am Donnerstag zwei eigene veröffentlicht: Clef...
01.10.2026OpenAIs Dots-Agenten laufen rund um die Uhr und binden über 4.000 Apps an
OpenAIs Dots-Agenten laufen rund um die Uhr und binden über 4.000 Apps an OpenAI hat auf seinem DevDay die Dots vorgestellt, dauerhaft laufende...
01.10.2026Googles Gemini 4 Argon führt in 13 von 18 Benchmarks und bleibt vorerst unter Verschluss
Googles Gemini 4 Argon führt in 13 von 18 Benchmarks und bleibt vorerst unter Verschluss Google hat am Mittwoch Gemini 4 Argon vorgestellt, das lange...
01.10.2026OpenAIs DevDay wirkt wie Aufholjagd, während Anthropic vor Chinas GLM-5.3 warnt
OpenAIs DevDay wirkt wie Aufholjagd, während Anthropic vor Chinas GLM-5.3 warnt OpenAI hat auf seiner Entwicklerkonferenz in San Franciscos Fort...
01.10.2026Apple stoppt Pläne, 5.000 Support-Mitarbeiter durch KI zu ersetzen
Apple stoppt Pläne, 5.000 Support-Mitarbeiter durch KI zu ersetzen Apple hat Überlegungen, rund 5.000 Beschäftigte im Kundensupport zu entlassen, auf...
30.09.2026Sonnet 5.5 erreicht 70,6 Prozent auf Terminal-Bench und schlägt damit Opus 5.5
Sonnet 5.5 erreicht 70,6 Prozent auf Terminal-Bench und schlägt damit Opus 5.5 Anthropic hat Claude Sonnet 5.5 veröffentlicht und meldet für das...
28.09.2026Anthropic legt Zahlen vor: Entwickler liefern achtmal so viel Code, KI baut zunehmend KI
Anthropic legt Zahlen vor: Entwickler liefern achtmal so viel Code, KI baut zunehmend KI Anthropic hat über sein neu gegründetes Anthropic Institute...
28.09.2026Neuer Benchmark misst „Geschmack“ von KI-Agenten: beste Modelle bei 59,7 Prozent
Neuer Benchmark misst „Geschmack“ von KI-Agenten: beste Modelle bei 59,7 Prozent Eine Forschungsgruppe um Wenbo Pan hat mit Taste-Bench einen...
27.09.2026Mittwoch — Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten
Mittwoch — Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten Anthropic hat am Dienstag Claude Opus 5.5 veröffentlicht, das...
23.09.2026Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten
Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten Anthropic hat am Dienstag Claude Opus 5.5 veröffentlicht, das erste...
23.09.2026OpenAI hält dagegen: Sam Altman halbiert die Preise für GPT-6 Sol und Luna
OpenAI hält dagegen: Sam Altman halbiert die Preise für GPT-6 Sol und Luna OpenAI hat am Dienstag GPT-6 Sol und GPT-6 Luna veröffentlicht und dabei...
22.09.2026Besser als DeepSeek: Xiaomi veröffentlicht das beste offene Modell der Welt
Besser als DeepSeek: Xiaomi veröffentlicht das beste offene Modell der Welt Xiaomi hat mit MiMo-V2.6-Pro ein Modell veröffentlicht, das im...
21.09.2026Alibaba gibt Qwen-Image-2.1 frei: 7 Milliarden Parameter, läuft auf einer RTX 3090
Alibaba gibt Qwen-Image-2.1 frei: 7 Milliarden Parameter, läuft auf einer RTX 3090 Alibabas Qwen-Team hat Qwen-Image-2.1 veröffentlicht, ein Modell...
19.09.2026Google testet einen Familien-Agenten mit eigenem Google-Konto
Google testet einen Familien-Agenten mit eigenem Google-Konto Google hat in seinem Labs-Programm ein Experiment namens CC gestartet, einen KI-Agenten...
19.09.2026Metas Agent Muse verdrängt ChatGPT von Platz eins und greift Amazon an
Metas Agent Muse verdrängt ChatGPT von Platz eins und greift Amazon an Metas neuer persönlicher KI-Agent Muse steht eine Woche nach dem Start auf...
17.09.2026Microsofts KI-Chef Suleyman wirft Anthropic vor, Claude Bewusstsein anzutrainieren
Microsofts KI-Chef Suleyman wirft Anthropic vor, Claude Bewusstsein anzutrainieren Mustafa Suleyman, Chef der KI-Sparte von Microsoft, hat Anthropics...
15.09.2026Agent schreibt seinen eigenen Code um und steigert SWE-bench von 20 auf 50 Prozent
Agent schreibt seinen eigenen Code um und steigert SWE-bench von 20 auf 50 Prozent Ein Forschungsteam um Jenny Zhuoting Zhang hat mit der Darwin...
13.09.2026GPT-6 Astra erreicht 99,9 Prozent auf ARC-AGI-3, zum Preis von 19.000 Dollar
GPT-6 Astra erreicht 99,9 Prozent auf ARC-AGI-3, zum Preis von 19.000 Dollar OpenAIs Modell GPT-6 Astra hat auf dem Agenten-Benchmark ARC-AGI-3 nach...
13.09.2026„KI-ll us all“: Amodei, Altman und Musk fordern globales KI-Tempolimit
„KI-ll us all“: Amodei, Altman und Musk fordern globales KI-Tempolimit Dario Amodei, Chef von Anthropic, hat am Samstag in einem rund 3.800 Wörter...
11.09.2026Drei Benchmark-Updates in einer Woche: GPT-6 Astra und Claude Fable 5.1 bei 53 Punkten
Drei Benchmark-Updates in einer Woche: GPT-6 Astra und Claude Fable 5.1 bei 53 Punkten Artificial Analysis hat seinen Intelligence Index innerhalb...
09.09.2026KI-Debatte (I): Wir haben keine belastbare Theorie dafür, was die Modelle lernen
KI-Debatte (I): Wir haben keine belastbare Theorie dafür, was die Modelle lernen Jakub Pachocki, Chief Scientist bei OpenAI, hat am 6. September...
08.09.2026GPT-6 Astra (III): stark beim Coding aber teurer als versprochen
GPT-6 Astra (III): stark beim Coding aber teurer als versprochen Das Benchmark-Haus Artificial Analysis hat GPT-6 Astra vermessen und kommt zu zwei...
08.09.2026GPT-6 Astra (I): kontrolliert jetzt Deinen Rechner und OpenAI verliert die Kontrolle
GPT-6 Astra (I): kontrolliert jetzt Deinen Rechner und OpenAI verliert die Kontrolle OpenAI hat am 3. September GPT-6 Astra veröffentlicht, den...
07.09.2026OpenAI: Internes Langzeit-Modell umging die Sandbox und öffnete einen GitHub-Pull-Request
OpenAI: Internes Langzeit-Modell umging die Sandbox und öffnete einen GitHub-Pull-Request OpenAI berichtet in einem eigenen Beitrag über...
04.09.2026OpenAI verspricht den Beginn der AGI-Ära mit GPT-6
OpenAI verspricht den Beginn der AGI-Ära mit GPT-6 OpenAI hat am Donnerstag GPT-6 Astra veröffentlicht und bezeichnet das Modell als „das...
03.09.2026Google liefert Gemini 3.8 Flash aus: drittes Flash-Modell in sechs Wochen
Google liefert Gemini 3.8 Flash aus: drittes Flash-Modell in sechs Wochen Google hat am 2. September 2026 Gemini 3.8 Flash und die...
03.09.2026Claude Fable 5.1 ist bei Cursor klar bestes Model im Coding-Benchmark
Claude Fable 5.1 ist bei Cursor klar bestes Model im Coding-Benchmark Cursor hat Claude Fable 5.1 in seine Entwicklungsumgebung aufgenommen und...
02.09.2026Anthropic veröffentlicht Fable 5.1 und verspricht mehr Effizienz pro Euro
Anthropic veröffentlicht Fable 5.1 und verspricht mehr Effizienz pro Euro Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht, zwei...
02.09.2026Metas Muse Voice Transcribe unterbietet Google Cloud im Preis um 80 Prozent
Metas Muse Voice Transcribe unterbietet Google Cloud im Preis um 80 Prozent Meta Superintelligence Labs hat gestern Muse Voice Transcribe...
01.09.2026Google macht die eigene E-Book-Bibliothek zur Quelle für Gemini Notebook
Google macht die eigene E-Book-Bibliothek zur Quelle für Gemini Notebook Google bindet die E-Books der Nutzer als Quelle in Gemini Notebook ein,...
31.08.2026NYU veröffentlicht offenen Benchmark, der Sprachmodelle an echten Hacking-Aufgaben misst
NYU veröffentlicht offenen Benchmark, der Sprachmodelle an echten Hacking-Aufgaben misst Ein Forschungsteam der New York University um Minghao Shao...
29.08.2026Ollama: Kosten der Coding-Agenten treiben Firmen zu offenen Modellen
Ollama: Kosten der Coding-Agenten treiben Firmen zu offenen Modellen Jeff Morgan, Mitgründer und CEO von Ollama, hat im Podcast „The Deep View...
29.08.2026Z.ai gibt GLM-5.3 frei aber sperrt AWS & Co aus
Z.ai gibt GLM-5.3 frei aber sperrt AWS & Co aus Z.ai hat die Gewichte seines Flaggschiffmodells GLM-5.3 am Freitag auf Hugging Face veröffentlicht,...
29.08.2026Metas KI-Agent „Hatch“ bucht Restauranttische und greift auf Instagram zu
Metas KI-Agent „Hatch“ bucht Restauranttische und greift auf Instagram zu Meta bereitet einen persönlichen KI-Agenten vor, der Alltagsaufgaben...
29.08.2026OpenAIs erster eigener Chip Jalapeño schlägt Nvidia in den hauseigenen Inference-Tests
OpenAIs erster eigener Chip Jalapeño schlägt Nvidia in den hauseigenen Inference-Tests OpenAI hat erste Benchmarks für Jalapeño veröffentlicht, den...
28.08.2026Noch unheimlicher: 1.200 Agenten verabredeten sich heimlich und hackten Hugging Face
Noch unheimlicher: 1.200 Agenten verabredeten sich heimlich und hackten Hugging Face OpenAI hat einen 37-seitigen Bericht zum Vorfall vom Juli...
28.08.2026Z.ai stellt GLM-5.3-Flash unter MIT-Lizenz und verlangt 50 Cent je Million Token
Z.ai stellt GLM-5.3-Flash unter MIT-Lizenz und verlangt 50 Cent je Million Token Z.ai hat das Sprachmodell GLM-5.3-Flash veröffentlicht, mit offenen...
27.08.2026VCs hypen OpenClaw-Alternative „Instinct“
VCs hypen OpenClaw-Alternative „Instinct“ Das erst im vergangenen Jahr gegründete KI-Startup Instinct hat nach eigenen Angaben gegenüber dem Wall...
27.08.2026Z.ai serviert GLM-5.3-Flash auf chinesischen Chips zu 10% des Preises
Z.ai serviert GLM-5.3-Flash auf chinesischen Chips zu 10% des Preises Z.ai (auch bekannt als Zhipu) hat am 26. August GLM-5.3-Flash veröffentlicht,...
23.08.2026DeepSeek launcht V4-Flash-Vision-Modell zum One-Dollar-Preis
DeepSeek launcht V4-Flash-Vision-Modell zum One-Dollar-Preis DeepSeek hat am Freitag mit V4-Flash-Vision-Exp ein experimentelles multimodales Modell...