TheVortiq

Etiqueta

inferencia local

a rack of electronic equipment in a dark room
Inteligencia Artificial14 de julio de 2026 · 4 min

Ejecutar LLMs en local: el coste real por token en GPU

Un estudio de Towards Data Science cuantifica el coste eléctrico real de ejecutar modelos de lenguaje grandes (LLMs) en una GPU local. Los resultados muestran que el coste por millón de tokens varía significativamente entre modelos, y que la eficiencia no siempre se correlaciona con el tamaño del modelo.

A computer chip with the letter ia printed on it
Inteligencia Artificial19 de junio de 2026 · 5 min

Ejecutan modelo de 397B parámetros en un PC con Ryzen AI Max+ 395

Un PC personalizado con AMD Ryzen AI Max+ 395 y 128 GB de RAM ha ejecutado un modelo de lenguaje de 397 mil millones de parámetros, una tarea que hace un año requería servidores con múltiples GPUs. Este hito marca un antes y después en la computación de IA en el borde.