「gpu-inference」の検索結果 1 件
大規模言語モデル向けの高スループットでメモリ効率に優れた推論・サービングエンジンで、単一のローカルマシンではなく、本番環境で大規模に LLM を運用するために作られています。