Modelos, Tokens y Parámetros
Los LLM (modelos de lenguaje) son el "cerebro" que procesa instrucciones y genera código o texto. Los tokens son la unidad mínima que consumen los modelos; tanto el input como el output usan tokens y suelen cobrar por volumen.
Parámetros del modelo y configuración de inferencia
Los parámetros internos del modelo ("weights") determinan su capacidad. Al consumir un LLM, se ajustan opciones de inferencia que moldean su comportamiento:
- Tamaño del modelo: Más parámetros = mejor razonamiento, pero requiere más memoria.
- Temperature: Controla creatividad. Valor bajo (0.0-0.2) = respuestas deterministas; alto (0.7-1.0) = más diversidad.
- Top-p / nucleus sampling: Limita el conjunto de tokens candidatos para generar una salida más coherente.
- Max tokens: Límite de tokens generados para evitar respuestas excesivas y controlar coste.
- Stream vs Batch: Stream permite recibir tokens en tiempo real; batch espera la respuesta completa.
Prompts, System Prompts y Técnicas de 'Shots'
El "prompt" es tu instrucción. Un "system prompt" define el rol del modelo. Zero-shot pide sin ejemplos; few-shot proporciona ejemplos de entrada/salida para guiar formato y estilo.
La Regla de Oro: El Contexto
El contexto incluye reglas de negocio, arquitectura, estilos y archivos con metadatos. Sin contexto, la IA propone soluciones genéricas; con contexto, produce código alineado a tu proyecto.
Asistente vs. Agente
El asistente (operario) responde a peticiones aisladas. El agente (arquitecto) es proactivo, analiza la codebase y propone un "Modo Plan" con cambios ordenados a través de archivos.
Decorar tu Proyecto
Crear archivos como agents.md y la carpeta .opencode/skills/ permite que el agente entienda reglas específicas (por ejemplo: "usar CSS puro, no Tailwind"). Esto evita que la IA haga cambios que rompan la arquitectura.
agents.md .agents/ skills/ docs/
Local vs. Nube
Modelos en la nube (GPT-4, DeepSeek) ofrecen máxima potencia y ventanas grandes, pero requieren conexión y exponen tu código. Modelos locales (Ollama, Llama) ofrecen privacidad total y funcionamiento offline, limitados por hardware.