Guillermo Casaus (@_guillecasaus) “No vuelvas a usar Ollama si quieres sacar el máximo rendimiento a tu IA local. N” — TopicDigg
Guillermo Casaus
@_guillecasaus
Especialista en IA y Automatización 🤖 | Comparto estrategias, herramientas y recursos tecnológicos | Cofundador de @gdnagency | DM para colaboraciones 📩
No vuelvas a usar Ollama si quieres sacar el máximo rendimiento a tu IA local.
No exprime al máximo la potencia de tu GPU.
Y eso se nota cuando empiezas a servir modelos más exigentes.
Por eso nació vLLM.
Un proyecto desarrollado originalmente en UC Berkeley para ejecutar modelos de IA de forma mucho más rápida, eficiente y preparada para producción.
→ Hasta 2 veces más rendimiento en determinadas cargas de trabajo
→ Compatible con más de 200 arquitecturas de modelos
→ API compatible con OpenAI para integrarlo fácilmente
→ Funciona con NVIDIA, AMD, Apple Silicon, TPU y mucho más
Se instala con un simple:
pip install vllm
Mientras Ollama está pensado para que cualquiera pueda ejecutar modelos de IA...
vLLM está diseñado para exprimir al máximo el hardware y servir modelos con el mejor rendimiento posible.
Tiene más de 85k stars en GitHub, es 100% gratis y open-source.
Repo en comentarios 👇