TorchSnap erstellt Multinode-Snapshots verteilter KI-Inferenz-Workloads über jeden Knoten eines Clusters, ohne dass Entwicklercode geändert werden muss, sodass laufende Jobs dort fortgesetzt werden können, wo sie aufgehört haben. TorchSnap ergänzt laut Vasudevan die Cluster-Resilienz von Clockwork als dritte Schutzschicht neben dem bestehenden Netzwerk-Failover-Tool LinkPass und der GPU-Migrationssoftware TorchPass.
LinkPass ermöglicht es LinkedIn, KI-Verkehr um optische Link- und Switch-Ausfälle herumzuleiten, damit Jobs bei Hardwareproblemen weiterlaufen. LinkedIn von Microsoft Corp. hat Clockworks LinkPass-Funktionalität laut SiliconANGLE über seine gesamte GPU-Flotte hinweg eingesetzt, um monatlich Tausende GPU-Stunden an Ausfallzeit zu vermeiden.
Seit seiner letzten Finanzierungsrunde vor etwas mehr als einem Jahr verzeichnet Clockwork laut SiliconANGLE eine schnelle Verbreitung seiner Software zur Steigerung der KI-Cluster-Effizienz bei öffentlichen Cloud-Infrastrukturanbietern, Neoclouds und Unternehmensflotten.
SemiAnalysis-Analyst Dylan Patel sagte laut SiliconANGLE, Cluster-Fehlertoleranz sei früher ein Trainingsproblem gewesen, heute aber auch ein Inferenzproblem. Patel sagte weiter, Clockwork.io halte Replikate bei Link-Ausfällen und Netzwerkfehlern am Laufen, und seine extrem schnellen Checkpoints beschleunigten die Gewichtsübertragung zurück in die Rollout-Flotte.
Teams können laut SiliconANGLE auf Anwendungsebene eine Checkpointing-Logik hinzufügen, damit nach einem Fehler weniger Fortschritt verloren geht und weniger Berechnung wiederholt wird. Die Quelle nennt keine Angaben zur Bewertung des Unternehmens, zu einzelnen Investorenanteilen oder zum Zeitplan für die Einführung von TorchSnap.
