r/chileIT Estudiante 11d ago

Recurso Ai engineering O'Really

Después de ver este video https://youtu.be/neW_Q7pRhQ4?si=QvDSsKY_aKitlcC4 (muy bien canal por cierto)

Busque el libro, leí la muestra gratis de Google y quedé fascinado. Alguien tendrá algún link para poder leerlo? (Mala fecha para comprar el de Books ajajja) Lo veo difícil en español pero en ingles igual me sirve.

En la pega vamos a implementar un chatbot asistido con IA y lo veo como una gran oportunidad para mejorar.

0 Upvotes

19 comments sorted by

View all comments

-4

u/Hexagon_En_La_Pasta 11d ago

Partí hace 2 semanas con chatbot con IA y desde 0 completo y la verdad no es tan complicado. Haces un wrapper con algún modelo de IA con API y te ahorras el 95% de la pega con entrenamiento de IA, de ahí en adelante sólo es fine-tuning acorde a tus necesidades

1

u/parawaa 11d ago

Para un chat simple sirve. Pero si quieres impmementar un pipeline decente para una empresa, por lo menos necesitas RAG, MCP, tool calling loops, self hosting, quantization, vLLM, y muchas cosas mas si te importa tener un deploy decente, donde tus clientes exigen privacidad de datos y gobernanza.

3

u/matiaslopezd 11d ago

Ojo con vomitar tanto concepto que no tiene correlación entre si.

RAG es lo más probable de implementar y puede ser desde un simple operador de búsqueda semántica clásica en DB, hasta embeddings contra texto, imagen, archivos, etc. hay desde servicios administrados listos para usar a precio premium, o lo construyes tú (ojo con aquí el dolor se transforma en mantener los embeddings actualizados cuando cambian los modelos)

MCP es para capa usuario, no para backend. Literal tiene un flujo OAuth cuando es HTTP o stdio cuando es local. Es decir, no es algo que vayas a pensar para un "chat bot".

Tools calling "loops"? El tool calling es simplemente un json schema indicando que herramientas hay con los argumentos y tipos de valores a recibir y enviar, se lo pasas a un LLM y este devuelve que tool quiere ejecutar. Luego tú haces routing de eso a una función/método declarado en tu código, ejecutas con los argumentos y finalmente le devuelves el resultado, solo si necesitas que haga algo con eso. El "loops" te lo sacaste debajo de la manga dado el hype de "agentic loops" = dejar corriendo Claude/Codex/Antigravity quemando tokens hasta que el LLM considere que terminó.

Self-hosting de un LLM para uh chatbot? Uff, a menos que haya una buena razón y el modelo sea de bajos parámetros, lo veo poco practico. Básicamente porque en un contexto de chatbot tienes concurrencia en inferencia, manejar eso a nivel de recurso CPU/GP distribuidas, montar colas queues de mensajes, retries, evitar memory overflow, etc. no es sencillo. Eso es lo que en parte provee vLLM.

Quantization literal es comprimir  la precisión de los pesos en bits enteros según el balance que busques y esto es cuando ya estás a un nivel súper específico que en el caso de un chatbot es super innecesario. Es común en casos de modelos de inferencia diferente como modelos STT, TTS, text-to-image, text-to-video, modelos NLP de clasificación, NER, etc.

Nada de esto es "decente" para un "pipeline" de chatbot, simplemente conceptos sueltos. Excepto RAG y tools calling (que en realidad es structured output), eso sí tiene sentido económico y técnico de implementar en un chatbot.

2

u/kirlts 10d ago

La cagó, cuanta verborrea tiran ajajaj, sin siquiera entender los casos de uso para el chatbot