Alle Unternehmen

Benchmark

41 Artikel erwähnen Benchmark

02.10.2026

Google: Gemini 4 ist besser als die Konkurrenz und bleibt besser noch in Mountain View

Google: Gemini 4 ist besser als die Konkurrenz und bleibt besser noch in Mountain View Google hat am Mittwoch Gemini 4 Argon vorgestellt, das lange...

02.10.2026

Cloudflare kontert Jev mit zwei offenen Clef-Modellen, zwei Wochen nach dessen Start

Cloudflare kontert Jev mit zwei offenen Clef-Modellen, zwei Wochen nach dessen Start Cloudflare hat am Donnerstag zwei eigene veröffentlicht: Clef...

01.10.2026

OpenAIs Dots-Agenten laufen rund um die Uhr und binden über 4.000 Apps an

OpenAIs Dots-Agenten laufen rund um die Uhr und binden über 4.000 Apps an OpenAI hat auf seinem DevDay die Dots vorgestellt, dauerhaft laufende...

01.10.2026

Googles Gemini 4 Argon führt in 13 von 18 Benchmarks und bleibt vorerst unter Verschluss

Googles Gemini 4 Argon führt in 13 von 18 Benchmarks und bleibt vorerst unter Verschluss Google hat am Mittwoch Gemini 4 Argon vorgestellt, das lange...

01.10.2026

OpenAIs DevDay wirkt wie Aufholjagd, während Anthropic vor Chinas GLM-5.3 warnt

OpenAIs DevDay wirkt wie Aufholjagd, während Anthropic vor Chinas GLM-5.3 warnt OpenAI hat auf seiner Entwicklerkonferenz in San Franciscos Fort...

01.10.2026

Apple stoppt Pläne, 5.000 Support-Mitarbeiter durch KI zu ersetzen

Apple stoppt Pläne, 5.000 Support-Mitarbeiter durch KI zu ersetzen Apple hat Überlegungen, rund 5.000 Beschäftigte im Kundensupport zu entlassen, auf...

30.09.2026

Sonnet 5.5 erreicht 70,6 Prozent auf Terminal-Bench und schlägt damit Opus 5.5

Sonnet 5.5 erreicht 70,6 Prozent auf Terminal-Bench und schlägt damit Opus 5.5 Anthropic hat Claude Sonnet 5.5 veröffentlicht und meldet für das...

28.09.2026

Anthropic legt Zahlen vor: Entwickler liefern achtmal so viel Code, KI baut zunehmend KI

Anthropic legt Zahlen vor: Entwickler liefern achtmal so viel Code, KI baut zunehmend KI Anthropic hat über sein neu gegründetes Anthropic Institute...

28.09.2026

Neuer Benchmark misst „Geschmack“ von KI-Agenten: beste Modelle bei 59,7 Prozent

Neuer Benchmark misst „Geschmack“ von KI-Agenten: beste Modelle bei 59,7 Prozent Eine Forschungsgruppe um Wenbo Pan hat mit Taste-Bench einen...

27.09.2026

Mittwoch — Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten

Mittwoch — Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten Anthropic hat am Dienstag Claude Opus 5.5 veröffentlicht, das...

23.09.2026

Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten

Opus 5.5 ist da: Anthropic verspricht mehr Performance zu niedrigeren Kosten Anthropic hat am Dienstag Claude Opus 5.5 veröffentlicht, das erste...

23.09.2026

OpenAI hält dagegen: Sam Altman halbiert die Preise für GPT-6 Sol und Luna

OpenAI hält dagegen: Sam Altman halbiert die Preise für GPT-6 Sol und Luna OpenAI hat am Dienstag GPT-6 Sol und GPT-6 Luna veröffentlicht und dabei...

22.09.2026

Besser als DeepSeek: Xiaomi veröffentlicht das beste offene Modell der Welt

Besser als DeepSeek: Xiaomi veröffentlicht das beste offene Modell der Welt Xiaomi hat mit MiMo-V2.6-Pro ein Modell veröffentlicht, das im...

21.09.2026

Alibaba gibt Qwen-Image-2.1 frei: 7 Milliarden Parameter, läuft auf einer RTX 3090

Alibaba gibt Qwen-Image-2.1 frei: 7 Milliarden Parameter, läuft auf einer RTX 3090 Alibabas Qwen-Team hat Qwen-Image-2.1 veröffentlicht, ein Modell...

19.09.2026

Google testet einen Familien-Agenten mit eigenem Google-Konto

Google testet einen Familien-Agenten mit eigenem Google-Konto Google hat in seinem Labs-Programm ein Experiment namens CC gestartet, einen KI-Agenten...

19.09.2026

Metas Agent Muse verdrängt ChatGPT von Platz eins und greift Amazon an

Metas Agent Muse verdrängt ChatGPT von Platz eins und greift Amazon an Metas neuer persönlicher KI-Agent Muse steht eine Woche nach dem Start auf...

17.09.2026

Microsofts KI-Chef Suleyman wirft Anthropic vor, Claude Bewusstsein anzutrainieren

Microsofts KI-Chef Suleyman wirft Anthropic vor, Claude Bewusstsein anzutrainieren Mustafa Suleyman, Chef der KI-Sparte von Microsoft, hat Anthropics...

15.09.2026

Agent schreibt seinen eigenen Code um und steigert SWE-bench von 20 auf 50 Prozent

Agent schreibt seinen eigenen Code um und steigert SWE-bench von 20 auf 50 Prozent Ein Forschungsteam um Jenny Zhuoting Zhang hat mit der Darwin...

13.09.2026

GPT-6 Astra erreicht 99,9 Prozent auf ARC-AGI-3, zum Preis von 19.000 Dollar

GPT-6 Astra erreicht 99,9 Prozent auf ARC-AGI-3, zum Preis von 19.000 Dollar OpenAIs Modell GPT-6 Astra hat auf dem Agenten-Benchmark ARC-AGI-3 nach...

13.09.2026

„KI-ll us all“: Amodei, Altman und Musk fordern globales KI-Tempolimit

„KI-ll us all“: Amodei, Altman und Musk fordern globales KI-Tempolimit Dario Amodei, Chef von Anthropic, hat am Samstag in einem rund 3.800 Wörter...

11.09.2026

Drei Benchmark-Updates in einer Woche: GPT-6 Astra und Claude Fable 5.1 bei 53 Punkten

Drei Benchmark-Updates in einer Woche: GPT-6 Astra und Claude Fable 5.1 bei 53 Punkten Artificial Analysis hat seinen Intelligence Index innerhalb...

09.09.2026

KI-Debatte (I): Wir haben keine belastbare Theorie dafür, was die Modelle lernen

KI-Debatte (I): Wir haben keine belastbare Theorie dafür, was die Modelle lernen Jakub Pachocki, Chief Scientist bei OpenAI, hat am 6. September...

08.09.2026

GPT-6 Astra (III): stark beim Coding aber teurer als versprochen

GPT-6 Astra (III): stark beim Coding aber teurer als versprochen Das Benchmark-Haus Artificial Analysis hat GPT-6 Astra vermessen und kommt zu zwei...

08.09.2026

GPT-6 Astra (I): kontrolliert jetzt Deinen Rechner und OpenAI verliert die Kontrolle

GPT-6 Astra (I): kontrolliert jetzt Deinen Rechner und OpenAI verliert die Kontrolle OpenAI hat am 3. September GPT-6 Astra veröffentlicht, den...

07.09.2026

OpenAI: Internes Langzeit-Modell umging die Sandbox und öffnete einen GitHub-Pull-Request

OpenAI: Internes Langzeit-Modell umging die Sandbox und öffnete einen GitHub-Pull-Request OpenAI berichtet in einem eigenen Beitrag über...

04.09.2026

OpenAI verspricht den Beginn der AGI-Ära mit GPT-6

OpenAI verspricht den Beginn der AGI-Ära mit GPT-6 OpenAI hat am Donnerstag GPT-6 Astra veröffentlicht und bezeichnet das Modell als „das...

03.09.2026

Google liefert Gemini 3.8 Flash aus: drittes Flash-Modell in sechs Wochen

Google liefert Gemini 3.8 Flash aus: drittes Flash-Modell in sechs Wochen Google hat am 2. September 2026 Gemini 3.8 Flash und die...

03.09.2026

Claude Fable 5.1 ist bei Cursor klar bestes Model im Coding-Benchmark

Claude Fable 5.1 ist bei Cursor klar bestes Model im Coding-Benchmark Cursor hat Claude Fable 5.1 in seine Entwicklungsumgebung aufgenommen und...

02.09.2026

Anthropic veröffentlicht Fable 5.1 und verspricht mehr Effizienz pro Euro

Anthropic veröffentlicht Fable 5.1 und verspricht mehr Effizienz pro Euro Anthropic hat Claude Fable 5.1 und Claude Mythos 5.1 veröffentlicht, zwei...

02.09.2026

Metas Muse Voice Transcribe unterbietet Google Cloud im Preis um 80 Prozent

Metas Muse Voice Transcribe unterbietet Google Cloud im Preis um 80 Prozent Meta Superintelligence Labs hat gestern Muse Voice Transcribe...

01.09.2026

Google macht die eigene E-Book-Bibliothek zur Quelle für Gemini Notebook

Google macht die eigene E-Book-Bibliothek zur Quelle für Gemini Notebook Google bindet die E-Books der Nutzer als Quelle in Gemini Notebook ein,...

31.08.2026

NYU veröffentlicht offenen Benchmark, der Sprachmodelle an echten Hacking-Aufgaben misst

NYU veröffentlicht offenen Benchmark, der Sprachmodelle an echten Hacking-Aufgaben misst Ein Forschungsteam der New York University um Minghao Shao...

29.08.2026

Ollama: Kosten der Coding-Agenten treiben Firmen zu offenen Modellen

Ollama: Kosten der Coding-Agenten treiben Firmen zu offenen Modellen Jeff Morgan, Mitgründer und CEO von Ollama, hat im Podcast „The Deep View...

29.08.2026

Z.ai gibt GLM-5.3 frei aber sperrt AWS & Co aus

Z.ai gibt GLM-5.3 frei aber sperrt AWS & Co aus Z.ai hat die Gewichte seines Flaggschiffmodells GLM-5.3 am Freitag auf Hugging Face veröffentlicht,...

29.08.2026

Metas KI-Agent „Hatch“ bucht Restauranttische und greift auf Instagram zu

Metas KI-Agent „Hatch“ bucht Restauranttische und greift auf Instagram zu Meta bereitet einen persönlichen KI-Agenten vor, der Alltagsaufgaben...

29.08.2026

OpenAIs erster eigener Chip Jalapeño schlägt Nvidia in den hauseigenen Inference-Tests

OpenAIs erster eigener Chip Jalapeño schlägt Nvidia in den hauseigenen Inference-Tests OpenAI hat erste Benchmarks für Jalapeño veröffentlicht, den...

28.08.2026

Noch unheimlicher: 1.200 Agenten verabredeten sich heimlich und hackten Hugging Face

Noch unheimlicher: 1.200 Agenten verabredeten sich heimlich und hackten Hugging Face OpenAI hat einen 37-seitigen Bericht zum Vorfall vom Juli...

28.08.2026

Z.ai stellt GLM-5.3-Flash unter MIT-Lizenz und verlangt 50 Cent je Million Token

Z.ai stellt GLM-5.3-Flash unter MIT-Lizenz und verlangt 50 Cent je Million Token Z.ai hat das Sprachmodell GLM-5.3-Flash veröffentlicht, mit offenen...

27.08.2026

VCs hypen OpenClaw-Alternative „Instinct“

VCs hypen OpenClaw-Alternative „Instinct“ Das erst im vergangenen Jahr gegründete KI-Startup Instinct hat nach eigenen Angaben gegenüber dem Wall...

27.08.2026

Z.ai serviert GLM-5.3-Flash auf chinesischen Chips zu 10% des Preises

Z.ai serviert GLM-5.3-Flash auf chinesischen Chips zu 10% des Preises Z.ai (auch bekannt als Zhipu) hat am 26. August GLM-5.3-Flash veröffentlicht,...

23.08.2026

DeepSeek launcht V4-Flash-Vision-Modell zum One-Dollar-Preis

DeepSeek launcht V4-Flash-Vision-Modell zum One-Dollar-Preis DeepSeek hat am Freitag mit V4-Flash-Vision-Exp ein experimentelles multimodales Modell...