Post-training degli LLM: PPO e GRPO
Come PPO e GRPO calcolano l'advantage e tengono stabile il training, perché GRPO risparmia un modello intero e come si progetta una funzione di reward che lo faccia funzionare.
Come PPO e GRPO calcolano l'advantage e tengono stabile il training, perché GRPO risparmia un modello intero e come si progetta una funzione di reward che lo faccia funzionare.
Da dove arriva il reward nel reinforcement learning, come si addestra un reward model con le preferenze, come il reward diventa un obiettivo di training e perché l'RL richiede così tanta memoria.
Come si calcola la loss sulle risposte, come gli iperparametri rendono stabile il training e come LoRA riduce la memoria necessaria per il fine-tuning.
Quali dati servono per fine-tuning e RL, come dividerli senza contaminazioni e come il testo diventa token che il modello può leggere e scrivere.
Come fine-tuning e RL costruiscono reasoning e sicurezza; le ricette di DeepSeek, Qwen e Llama; il lab base vs instruct vs RL. (SECONDA PARTE)
Cos'è il post-training, dove si colloca nel ciclo di vita di un LLM e cosa rende efficaci fine-tuning e RL. (PRIMA PARTE)
I fallimenti più subdoli di un agente emergono alle intersezioni tra Goal, Plan e Action, non vengono evidenziati valutando groundness e context relevance (RAG Triad)
Tracing con MLflow e RAG Triad con gli scorer TruLens: Context Relevance, Groundedness e Answer Relevance sul sistema multi-agent.
Implementazione di un sistema multi-agente con LangGraph: Planner, Executor, sub-agent ReAct e stato condiviso.
L'agent loop, l'harness e le operazioni di memoria dentro e fuori dal ciclo: assembliamo tutti i pezzi in un agente stateful che persiste tra le sessioni. (QUARTA E ULTIMA PARTE)