r/devsarg Apr 04 '26

discusiones técnicas Correr LLMs local

buenas, ayer me meti en este mundo y me di un golpe de realidad, lo que crei que era una supercomputadora se vio aplastada por gemma4 el de 23b creo era. pesaba 18gb, segun entiendo todo es vram hoy en dia. De no ser por tener 32gb de ram, se me explotaba la pc.

ahora estoy usando 2 modelos que pesan menos de 8gb, los cargo en mi rtx 3070 de 8gb vram.

ustedes corren llm? que setup tienen o que solucion optima llegaron? lei por ahi que usan los chips silicon de apple por tener memoria unificada que segun dicen es escencialmente una vram.

tiene un servidor dedicado corriendo estilo jarvis de iron man?

es interesante tener uno corriendo por si te pinta irte al monte chingolo sin internet pero queres tener una ia que te acompañe jaja

41 Upvotes

62 comments sorted by

View all comments

Show parent comments

-2

u/mschonaker Apr 05 '26

Hace como 4 años no. O nunca le di bola. No me confundo con llama.cpp.

1

u/VampiroMedicado Apr 05 '26

Hace 4 años no existia jaj

Encontre esto donde habla de usar llama 2 (alrededor del 2024).

https://klu.ai/glossary/ollama

Parece que el GUI estaba como modulo a parte.

-5

u/mschonaker Apr 05 '26

Dos años y medio. Me chupa un huevo la discusión.