DeepSpeed
Biblioteca de optimización de deep learning de Microsoft para entrenar y ejecutar modelos muy grandes de forma eficiente en múltiples GPUs.
Descripción general
DeepSpeed implementa técnicas eficientes en memoria y comunicación —como el particionado del estado del optimizador ZeRO— que permiten a los equipos entrenar modelos mucho más grandes de lo que cabría normalmente en la memoria de GPU disponible, y acelera el entrenamiento en múltiples GPUs y máquinas. Se integra con PyTorch (también en este catálogo) en lugar de sustituirlo.
DeepSpeed encaja en equipos que entrenan modelos grandes que llevan al límite el hardware disponible, una capa de optimización especializada sobre PyTorch en lugar de un framework de propósito general; la mayoría de los equipos recurren a él específicamente cuando el entrenamiento estándar de una sola GPU o multi-GPU básico no es suficiente.
- Categorías
- IA y Machine Learning
- Palabras clave
- distributed-trainingdeep-learningmodel-optimization
- Lenguajes
- Python
- Licencia
- Apache-2.0
Proyectos relacionados
PyTorch
BSD-3-ClauseFramework de machine learning de código abierto que acelera el camino desde el prototipado en investigación hasta el despliegue en producción.
- IA y Machine Learning
TensorFlow
Apache-2.0Plataforma de código abierto de extremo a extremo para machine learning, desde la investigación hasta la producción.
- IA y Machine Learning
Unsloth
Apache-2.0Biblioteca para hacer fine-tuning de grandes modelos de lenguaje significativamente más rápido y con menos memoria que los enfoques de entrenamiento estándar.
- IA y Machine Learning
CAMEL
Apache-2.0Framework de código abierto para investigar y construir sistemas de múltiples agentes de IA que se comunican, interpretan roles y colaboran de forma autónoma.
- IA y Machine Learning
¿Encontraste un error? Sugiere una edición en GitHub.