dataqbs

ZGCM-1: Ein vollständig offenes und äußerst effizientes Grundmodell für Mathematik und agentische Suche

· Quelle: arXiv cs.AI

ZGCM‑1 ist ein 7‑Billionen‑Parameter‑Modell, das von Grund auf neu trainiert wurde und dabei einen Ansatz verfolgt, der die effiziente Nutzung von Daten, Ressourcen und Algorithmen in den Vordergrund stellt. Die Autoren argumentieren, dass kompakte Modelle zwar nicht die gesamte Web‑Information speichern können, ihre Kapazitätsgrenzen jedoch durch die Kombination von internem, deliberativem Denken und der aktiven Nutzung externer Werkzeuge ausgleichen lassen. Für Kontexte von bis zu 256 Tausend Tokens wurde eine hybride Architektur entwickelt, die zwischen gleitenden Fenstern und vollständiger Aufmerksamkeit wechselt und einen Low‑Precision‑Optimierer namens Muon (FP8) einsetzt. Das Training folgt einem progressiven Curriculum, das die Kontextgröße schrittweise von 16 K über 64 K bis 256 K erhöht und Interaktionssequenzen als Markov‑Entscheidungsprozesse umformuliert, um das Verhalten von Agenten zu erlernen. Zusätzlich wurde ein automatisierter Workflow implementiert, bei dem Agentenverbände die Cluster‑Infrastruktur, Datenauswahl und schnelle Diagnosebewertung steuern. Die Tests zeigen, dass ZGCM‑1‑7B in seiner Familie konkurrenzfähig bleibt und bei mathematischem Denken sowie agentenbasierter Suche Leistungen liefert, die denen deutlich größerer Modelle wie Qwen3‑235B‑A22B und GLM‑5.1 entsprechen. Der Trainingsprozess ist etwa 4,2 mal schneller bei 16 K‑Tokens. Alle Gewichte, Codes und Daten sind öffentlich zugänglich, sodass die Community sie untersuchen und erweitern kann. Diese Entwicklung verdeutlicht, dass kleinere Modelle durch architektonische und trainingsbezogene Innovationen die Leistung großer Systeme nachahmen können, was die Entwicklung zugänglicherer und nachhaltigerer KI‑Anwendungen fördert und die kollaborative Forschung beschleunigt.

Originalartikel lesen auf arXiv cs.AI

Diese Zusammenfassung ist eine informationelle Synthese von dataqbs.com. Alle Rechte am Originalinhalt liegen beim Autor und dem genannten Medienunternehmen. Wir handeln ausschließlich als Kuratoren von Technologie-Nachrichten und beanspruchen keine Urheberschaft.

Lesen Sie dies auf Español · English