Forschung
Das physikalische Maximum. Lokal.
Lokale KI ist die richtige Antwort auf die Datenfrage: Ihre Dokumente, Ihre Anfragen und Ihr Modell bleiben im Haus. Aber lokale KI muss effizient sein. Große Cloud-Anbieter gleichen ineffiziente Modelle mit massenhafter Rechenleistung aus. Ein Unternehmen mit einem Server im Schrank kann das nicht.
Wir schneiden KI-Architekturen auf Kunden zu und arbeiten zugleich daran, sie grundlegend effizienter zu machen: Trainings- und Inferenzverfahren, die KI sparsamer und nachhaltiger machen, ohne Leistung aufzugeben. Unser Ziel ist, Ihnen langfristig das physikalische Maximum anzubieten: die beste Antwortqualität, die sich aus jedem Watt und jedem Byte Speicherbandbreite herausholen lässt.
Präzisionsleiter
16Bit
BF16 · Industriestandard
Der übliche Weg: hohe Präzision, hoher Speicher- und Energiebedarf.
4Bit
NVFP4 · Heute in Produktion
Unsere Kundenmodelle: in FP8 feingetunt, in 4 Bit ausgeliefert, lauffähig auf Ihrer Hardware.
1Bit
1 Bit · Unsere Forschung
Unser Labor: trainierbare 1-Bit-Architekturen für Standardhardware.
Präzisionsleiter · Bits pro Gewicht
Wo wir heute stehen
Kundenmodelle tunen wir in 8-Bit-Präzision (FP8) fein und liefern sie für Blackwell-Karten in NVFP4 (4 Bit) aus, für alle anderen Karten in BF16. Der Weg von 8 Bit im Training zu 4 Bit im Betrieb ist Produktionsalltag bei uns und die Basis unserer Forschung.
Was das für Sie bedeutet
Mehr Modell pro Gerät: Dieselbe Hardware trägt ein größeres Modell oder antwortet schneller. Auf längere Sicht werden kleinere, günstigere und sparsamere Geräte möglich, und der Energieverbrauch pro Antwort sinkt.
1-Bit-Architekturen
Unser aktueller Schwerpunkt sind extrem niedrig quantisierte Modellarchitekturen, bis hinunter zu einem Bit pro Gewicht. Solche Modelle brauchen nur einen Bruchteil des Speichers und der Rechenleistung heutiger Modelle und laufen dadurch auch auf Standardhardware schnell, ganz ohne Spezialbeschleuniger oder Rechenzentrum.
Die Herausforderung liegt im Training solcher Modelle, weniger im Ausführen. Dafür haben wir eigene Architekturen und Trainingsverfahren entwickelt; deren Details veröffentlichen wir bewusst nicht.
In unseren Experimenten erreichen wir damit erhebliche Beschleunigungen auf Standardhardware, ohne nennenswert an Antwortqualität zu verlieren.
Sie forschen selbst an effizienter KI?
Wir tauschen uns gern aus: zu Kooperationen, gemeinsamen Experimenten oder unseren Verfahren.
Kontakt aufnehmen