1 Projekt gefunden für "gpu-inference"
Durchsatzstarke, speichereffiziente Inferenz- und Serving-Engine für große Sprachmodelle, gebaut für den Betrieb von LLMs im großen Maßstab in Produktion statt nur auf einer einzelnen lokalen Maschine.