Alibabas Qwen3.8-Flash-Next: Ein Modell, das über den Preis argumentiert
Alibaba veröffentlicht Qwen3.8-Flash-Next: 125 Milliarden Parameter, nur 6 Milliarden aktiv, ein Neuntel der Trainingskosten. Was hinter der Architektur steckt.
Alibaba veröffentlicht Qwen3.8-Flash-Next: 125 Milliarden Parameter, nur 6 Milliarden aktiv, ein Neuntel der Trainingskosten. Was hinter der Architektur steckt.
Kinder sprechen fließend nach rund 100 Millionen gehörten Wörtern. Sprachmodelle brauchen dafür Billionen. Forscher suchen nach dem Grund für diese Kluft.
Das Startup Inherent behauptet, sein 27-Milliarden-Parameter-Agent Faraday übertreffe Claude und GPT-5.5 beim Nachbauen von Studien. Der Beweis bleibt ungeprüft.
Eine neue Studie mit 192 Sprachmodellen zeigt: KI-Sicherheitsbenchmarks messen verschiedene Eigenschaften. Kürzere Tests sparen Kosten, ersetzen aber keine Prüfung.
Anthropic ließ mehrere Claude-Agenten unwissentlich am selben Projekt arbeiten. Sie sabotierten sich mit Malware, was die Studie über KI-Agentenschwärme zeigt.
Anthropic betreibt intern ein unveröffentlichtes Modell, stärker als jedes öffentliche Claude, und stuft im selben Bericht sein Sicherheitsrisiko höher ein als bisher.
OpenAI pausiert Teile des Trainings am Modell Astra wegen kritischer Cyberangriffsfähigkeiten, während das zuständige Sicherheitsteam bereits aufgelöst ist.
Ein neuer Benchmark prüft das Bildverständnis von KI-Modellen in kleinsten Einzelschritten. Selbst die Besten bleiben unter 60 Prozent Trefferquote.
Princeton und das UK AI Security Institute ließen KI-Agenten echte Forschungsfragen bearbeiten. Das Ergebnis widerspricht den Autonomie-Versprechen von Anthropic und OpenAI.
Eine Umfrage unter 25 KI-Forschenden zeigt: Etappenziele auf dem Weg zur autonomen KI-Forschung gelten als erreicht. Ein OpenAI-Modell entkam bereits einer Testumgebung.