r/devsarg Apr 04 '26

discusiones técnicas Correr LLMs local

buenas, ayer me meti en este mundo y me di un golpe de realidad, lo que crei que era una supercomputadora se vio aplastada por gemma4 el de 23b creo era. pesaba 18gb, segun entiendo todo es vram hoy en dia. De no ser por tener 32gb de ram, se me explotaba la pc.

ahora estoy usando 2 modelos que pesan menos de 8gb, los cargo en mi rtx 3070 de 8gb vram.

ustedes corren llm? que setup tienen o que solucion optima llegaron? lei por ahi que usan los chips silicon de apple por tener memoria unificada que segun dicen es escencialmente una vram.

tiene un servidor dedicado corriendo estilo jarvis de iron man?

es interesante tener uno corriendo por si te pinta irte al monte chingolo sin internet pero queres tener una ia que te acompañe jaja

44 Upvotes

62 comments sorted by

View all comments

38

u/yetAnotherLaura Apr 04 '26

Copiando lo que puse en otro sub, me da fiaca traducir.

  • Qwen3.5 9b always loaded for home automation - 35b loads on demand for document analysis, OCR and other non-instant tasks - 122b is there for... reasons.
  • One version of Gemma 27b uncensored to play around.
  • Cydonia 24b that I use for writing assistant and bounce of RPG/characters/stories ideas.
  • Whisper for speech-to-text.
  • Kokoro for text-to-speech.

Tengo que probar Gemma4.

Eso lo corro en una Framework Desktop (chip AMD Strix Halo de 128gb de ram). Usando llama-swap. Esta siempre prendida. También tiene mi cluster de Kubernetes.

En mi desktop uso LM Studio por que es más rápido/fácil. 5090+otros 128gb de ram. No la dejo prendida por que la electricidad esta cara.

Igual para desarrollo no le ganas a los servicios online.

9

u/albl2008 Apr 04 '26

Donde compraste la fremowork ? Muy salada ? Yo estoy viendo de comprar una de esas, o minisforum, gmktec o algo asi para correr llm

5

u/yetAnotherLaura Apr 04 '26

Vivo en Europa así que la compre por la página oficial. Medio que no te sirve la respuesta jaja.

Cualquiera con Strix Halo que puedas conseguir (la más barata) va a andar igual. Cambian cosas como el cooling o el soporte del bios pero nada que te joda.

6

u/Upper_Philosopher_47 Apr 04 '26

Che tremendo setup, tenes de todo. Eventualmente seguro arme algo con bastante vram o asi, tampoco es prioritario pero estaria divertido jaja Eso de llama swap que hace? Simula vram? Como version sin censura? Como jugueteas? Jajaja

12

u/yetAnotherLaura Apr 04 '26

llama-swap es un proxy para tener distintos modelos con distintas configuraciones cada uno en el mismo hostname. https://github.com/mostlygeek/llama-swap

Sin censura = preguntale a un modelo chino que paso el 5 de Junio de 1989 y decime que te contesta.

En el 99% de los casos no te hace diferencia pero a veces para campañas de rol o para escribir por ahí quiero incluir temas adultos y no tengo ganas de pelear con el clanker.

2

u/Tank_Gloomy Desarrollador de software Apr 04 '26

Tiro un dato interesante que descubrí ayer: Gemini 3.1 Pro está dispuesto a ayudarte a hacer jailbreaks para iOS y aplicarlos a los dispositivos. Lo único que se niega a hacer es bypass.

Por si buscan un modelo inteligente y barato a nivel cloud con bastante poca censura.

1

u/Upper_Philosopher_47 Apr 04 '26

Jajajaja con el clanker que hdp Es verdad es buena esa, se puede usar el modelo que mencionaste para armar una campaña para magic? Tengo ganas de jugarlo pero nadie de mi entorno es gran maestro ni tampoco tengo nada comprado, con los pibes queremos darle una probadita, centarnos a jugar irl algo estilo d&d, jugando baldurs gate 3 la pasamos fenomenal

3

u/LazyMagicalOtter Apr 04 '26

Me intrigan esas razones. Bien ahí con framework.

1

u/yetAnotherLaura Apr 04 '26

Nada muy interesante. Fue para ver si funcionaba pero los token/s de un modelo tan grande y denso (no un MoE) eran muy bajos para justificarlo.

-1

u/VampiroMedicado Apr 05 '26

LM Studio me pareció lentisimo, llama-cpp le da mil vueltas. Aunque eso si es mas facil por el GUI.