Benchmark
41 Artikels nöömt Benchmark
Google: Gemini 4 is beter as de Konkurrenz un blifft beter noch in Mountain View
Google: Gemini 4 is beter as de Konkurrenz un blifft beter noch in Mountain View Google hett an'n Middeweek Gemini 4 Argon vörstellt, dat lang...
02.10.2026Cloudflare kontert Jev mit twee apen Clef-Modellen, twee Weken na sien Start
Cloudflare kontert Jev mit twee apen Clef-Modellen, twee Weken na sien Start Cloudflare hett an'n Dunnersdag twee egene Decision Models publizeert:...
01.10.2026OpenAIs Dots-Agenten loopt rund üm de Klock un binnt över 4.000 Apps an
OpenAIs Dots-Agenten loopt rund üm de Klock un binnt över 4.000 Apps an OpenAI hett op sien DevDay de Dots vörstellt, duerhaft lopen Agenten, de vun...
01.10.2026Googles Gemini 4 Argon föhrt in 13 vun 18 Benchmarks un blifft vöreerst ünner Versluss
Googles Gemini 4 Argon föhrt in 13 vun 18 Benchmarks un blifft vöreerst ünner Versluss Google hett an'n Middeweek Gemini 4 Argon vörstellt, dat lang...
01.10.2026OpenAIs DevDay wirkt as en Opholjagd, wieldes Anthropic vör Chinas GLM-5.3 wohrschaut
OpenAIs DevDay wirkt as en Opholjagd, wieldes Anthropic vör Chinas GLM-5.3 wohrschaut OpenAI hett op sien Entwicklerkonferenz in San Franciscos Fort...
01.10.2026Apple stoppt Plään, 5.000 Support-Mitarbeiders dörch KI to ersetten
Apple stoppt Plään, 5.000 Support-Mitarbeiders dörch KI to ersetten Apple hett Överleggen, üm un bi 5.000 Beschäftigte in'n Kunnensupport to...
30.09.2026Sonnet 5.5 kriggt 70,6 Perzent op Terminal-Bench un sleit dormit Opus 5.5
Sonnet 5.5 kriggt 70,6 Perzent op Terminal-Bench un sleit dormit Opus 5.5 Anthropic hett Claude Sonnet 5.5 rutbröcht un mellt för dat Modell 70,6...
28.09.2026Anthropic leggt Tallen vör: Entwicklers levert achtmal so veel Code, KI boot jümmer mehr KI
Anthropic leggt Tallen vör: Entwicklers levert achtmal so veel Code, KI boot jümmer mehr KI Anthropic hett över sien nee grünnt Anthropic Institute...
28.09.2026Ne'e Benchmark meet „Smack“ vun KI-Agenten: beste Modellen bi 59,7 Perzent
Ne'e Benchmark meet „Smack“ vun KI-Agenten: beste Modellen bi 59,7 Perzent En Forschergrupp üm Wenbo Pan hett mit Taste-Bench en Benchmark vörstellt,...
27.09.2026Middeweek — Opus 5.5 is dor: Anthropic versprickt mehr Performance to legere Kosten
Middeweek — Opus 5.5 is dor: Anthropic versprickt mehr Performance to legere Kosten Anthropic hett an'n Dingsdag Claude Opus 5.5 publizeert, dat...
23.09.2026Opus 5.5 is dor: Anthropic versprickt mehr Performance to legeren Kosten
Opus 5.5 is dor: Anthropic versprickt mehr Performance to legeren Kosten Anthropic hett an'n Dingsdag Claude Opus 5.5 rutbröcht, dat eerste Modell...
23.09.2026OpenAI hollt dorgegen: Sam Altman halbeert de Priesen för GPT-6 Sol un Luna
OpenAI hollt dorgegen: Sam Altman halbeert de Priesen för GPT-6 Sol un Luna OpenAI hett an'n Dingsdag GPT-6 Sol un GPT-6 Luna rutbröcht un dorbi de...
22.09.2026Beter as DeepSeek: Xiaomi bringt dat beste apen Modell vun de Welt rut
Beter as DeepSeek: Xiaomi bringt dat beste apen Modell vun de Welt rut Xiaomi hett mit MiMo-V2.6-Pro en Modell rutbröcht, dat in'n Intelligence Index...
21.09.2026Alibaba gifft Qwen-Image-2.1 free: 7 Milliarden Parameters, löppt op en RTX 3090
Alibaba gifft Qwen-Image-2.1 free: 7 Milliarden Parameters, löppt op en RTX 3090 Alibabas Qwen-Team hett Qwen-Image-2.1 publizeert, en Modell mit...
19.09.2026Google testt en Familien-Agenten mit egen Google-Konto
Google testt en Familien-Agenten mit egen Google-Konto Google hett in sien Labs-Programm en Experiment mit den Naam CC start, en KI-Agenten för...
19.09.2026Meta sien Agent Muse verdrängt ChatGPT vun Platz een un grippt Amazon an
Meta sien Agent Muse verdrängt ChatGPT vun Platz een un grippt Amazon an Meta sien ne'en persönlichen KI- Agent Muse steiht een Week na den Start op...
17.09.2026Microsofts KI-Baas Suleyman smitt Anthropic vör, Claude Bewusstween antotraineern
Microsofts KI-Baas Suleyman smitt Anthropic vör, Claude Bewusstween antotraineern Mustafa Suleyman, Baas vun de KI-Sparte vun Microsoft, hett...
15.09.2026Agent schrifft sien egen Code üm un steigert SWE-bench vun 20 op 50 Perzent
Agent schrifft sien egen Code üm un steigert SWE-bench vun 20 op 50 Perzent En Forschungsteam üm Jenny Zhuoting Zhang hett mit de Darwin Gödel...
13.09.2026GPT-6 Astra reckt 99,9 Perzent op ARC-AGI-3, to'n Pries von 19.000 Dollar
GPT-6 Astra reckt 99,9 Perzent op ARC-AGI-3, to'n Pries von 19.000 Dollar OpenAI sien Modell GPT-6 Astra hett op den Agenten-Benchmark ARC- AGI -3 na...
13.09.2026„KI-ll us all“: Amodei, Altman un Musk foddert en weltwiet KI-Tempolimit
„KI-ll us all“: Amodei, Altman un Musk foddert en weltwiet KI-Tempolimit Dario Amodei, Baas von Anthropic, hett an'n Sünnavend in en rund 3.800 Wöör...
11.09.2026Dree Benchmark-Updates in een Week: GPT-6 Astra un Claude Fable 5.1 bi 53 Punkten
Dree Benchmark-Updates in een Week: GPT-6 Astra un Claude Fable 5.1 bi 53 Punkten Artificial Analysis hett sien Intelligence Index binnen fief Daag...
09.09.2026KI-Debatt (I): Wi hebbt keen belastbore Theorie dorför, wat de Modellen lehrt
KI-Debatt (I): Wi hebbt keen belastbore Theorie dorför, wat de Modellen lehrt Jakub Pachocki, Chief Scientist bi OpenAI, hett an'n 6. September en...
08.09.2026GPT-6 Astra (III): stark bi't Coden, man dürer as verspraken
GPT-6 Astra (III): stark bi't Coden, man dürer as verspraken Dat Benchmark-Huus Artificial Analysis hett GPT-6 Astra vermeten un kummt to twee...
08.09.2026GPT-6 Astra (I): kontrolleert nu dien Reker un OpenAI verlüst de Kontroll
GPT-6 Astra (I): kontrolleert nu dien Reker un OpenAI verlüst de Kontroll OpenAI hett an'n 3. September GPT-6 Astra rutbröcht, de eerste grote...
07.09.2026OpenAI: Intern Langtiet-Modell umgeiht de Sandbox un maakt en GitHub-Pull-Request apen
OpenAI: Intern Langtiet-Modell umgeiht de Sandbox un maakt en GitHub-Pull-Request apen OpenAI bericht in en egen Bidrag över nich wünscht Verhollen...
04.09.2026OpenAI versprickt den Anfang vun de AGI-Ära mit GPT-6
OpenAI versprickt den Anfang vun de AGI-Ära mit GPT-6 OpenAI hett an'n Dunnersdag GPT-6 Astra rutbröcht un nöömt dat Modell „dat klöökste un best...
03.09.2026Google levert Gemini 3.8 Flash ut: drüdde Flash-Modell in sess Weken
Google levert Gemini 3.8 Flash ut: drüdde Flash-Modell in sess Weken Google hett an'n 2. September 2026 Gemini 3.8 Flash un de Sekerheitsvariant...
03.09.2026Claude Fable 5.1 is bi Cursor kloor dat beste Modell in'n Coding-Benchmark
Claude Fable 5.1 is bi Cursor kloor dat beste Modell in'n Coding-Benchmark Cursor hett Claude Fable 5.1 in sien Entwicklungsumgegend opnahmen un...
02.09.2026Anthropic bringt Fable 5.1 rut un versprickt mehr Effizienz för jeden Euro
Anthropic bringt Fable 5.1 rut un versprickt mehr Effizienz för jeden Euro Anthropic hett Claude Fable 5.1 un Claude Mythos 5.1 rutbrocht, twee...
02.09.2026Meta sien Muse Voice Transcribe ünnerbedt Google Cloud in'n Pries üm 80 Perzent
Meta sien Muse Voice Transcribe ünnerbedt Google Cloud in'n Pries üm 80 Perzent Meta Superintelligence Labs hett güstern Muse Voice Transcribe...
01.09.2026Google maakt de egene E-Book-Bibliothek to’n Born för Gemini Notebook
Google maakt de egene E-Book-Bibliothek to’n Born för Gemini Notebook Google binnt de E-Books vun de Gebrukers as Born in Gemini Notebook in, mellt...
31.08.2026NYU maakt apenen Benchmark publiek, de Spraakmodellen an echte Hacking-Opgaaven meten deit
NYU maakt apenen Benchmark publiek, de Spraakmodellen an echte Hacking-Opgaaven meten deit En Forschungsteam vun de New York University üm Minghao...
29.08.2026Ollama: Kosten vun Coding-Agenten drievt Firmen to apen Modellen
Ollama: Kosten vun Coding-Agenten drievt Firmen to apen Modellen Jeff Morgan, Mitgrünner un CEO vun Ollama, hett in'n Podcast „The Deep View...
29.08.2026Z.ai gifft GLM-5.3 free, aver sperrt AWS & Co ut
Z.ai gifft GLM-5.3 free, aver sperrt AWS & Co ut Z.ai hett de Gewichte vun sien Flaggschippmodell GLM-5.3 an'n Freedag op Hugging Face publizeert,...
29.08.2026Metas KI-Agent „Hatch“ bookt Restaurantdischen un grippt op Instagram to
Metas KI-Agent „Hatch“ bookt Restaurantdischen un grippt op Instagram to Meta maakt en persönlichen KI-Agenten trecht, de Alldagsopgaven egenstännig...
29.08.2026OpenAIs eerste egen Chip Jalapeño slött Nvidia in de huusegenen Inference-Tests
OpenAIs eerste egen Chip Jalapeño slött Nvidia in de huusegenen Inference-Tests OpenAI hett eerste Benchmarks för Jalapeño publizeert, den gemeensam...
28.08.2026Noch gruseliger: 1.200 Agenten hebbt sik heemlich afsnackt un Hugging Face hackt
Noch gruseliger: 1.200 Agenten hebbt sik heemlich afsnackt un Hugging Face hackt OpenAI hett en 37-siedigen Bericht to den Vörfall vun Juli rutgeven,...
28.08.2026Z.ai stellt GLM-5.3-Flash ünner MIT-Lizenz un verlangt 50 Cent je Million Token
Z.ai stellt GLM-5.3-Flash ünner MIT-Lizenz un verlangt 50 Cent je Million Token Z.ai hett dat Sprachmodell GLM-5.3-Flash rutbröcht, mit apen...
27.08.2026VCs hypen OpenClaw-Alternativ „Instinct“
VCs hypen OpenClaw-Alternativ „Instinct“ Dat eerst in't verleden Johr grünnte KI-Startup Instinct hett na egen Angaven gegenöver dat Wall Street...
27.08.2026Z.ai serveert GLM-5.3-Flash op chineesche Chips to 10% vun den Pries
Z.ai serveert GLM-5.3-Flash op chineesche Chips to 10% vun den Pries Z.ai (ok bekannt as Zhipu) hett an'n 26. August GLM-5.3-Flash rutbröcht, dat...
23.08.2026Guerilla-Marketing: Nieg Frontier-Modell in'n Stealth-Modus erovert OpenRouter
Guerilla-Marketing: Nieg Frontier-Modell in'n Stealth-Modus erovert OpenRouter En unbekannt Labor hett an'n 20. August en anonym Frontier-Modell mit...