Temperatura en el muestreo de LLM: definición y ejemplos reales

Temperature (in sampling)

La temperatura es un parámetro utilizado en los modelos de generación de texto que controla la aleatoriedad o la creatividad del resultado. Afecta a cómo el modelo elige la siguiente palabra al generar texto utilizando métodos basados en el muestreo.

Una temperatura más alta hace que el resultado sea más diverso y sorprendente, mientras que una temperatura más baja lo hace más predecible y enfocado.

Cómo funciona

Cuando un modelo de lenguaje predice la siguiente palabra, asigna probabilidades a todas las opciones posibles. La temperatura ajusta estas probabilidades antes de elegir una palabra.

Las temperaturas más bajas hacen que las palabras de alta probabilidad sean aún más probables, reduciendo la variación. Las temperaturas más altas aplanan la distribución de probabilidad, dando a más opciones la oportunidad de ser seleccionadas.

Escala de valores

La temperatura normalmente oscila entre 0 y 2, aunque los valores pueden variar dependiendo del modelo o el marco de trabajo.

  • Temperatura = 0
    El modelo se vuelve determinista, siempre eligiendo la palabra más probable (similar a la decodificación greedy).
  • Temperatura = 0,7 a 1,0
    Este rango se utiliza a menudo para obtener resultados equilibrados: creativos pero aún relevantes.
  • Temperatura > 1,0
    El resultado se vuelve más aleatorio y menos enfocado. Dependiendo de la tarea, esto puede conducir a la creatividad o a la incoherencia.

Propósito y uso

El parámetro de temperatura ajusta la creatividad y la variabilidad de la generación de texto. Puede ajustar el resultado del modelo para que coincida con el tono y el estilo deseados controlando la temperatura.

Una temperatura más alta (alrededor de 0,8 a 1,5) fomenta respuestas más diversas e imaginativas en aplicaciones creativas como la narración de cuentos, la lluvia de ideas o la escritura poética. Esto es útil cuando se desea que el modelo explore una amplia gama de ideas o genere algo inesperado.

En cambio, se prefiere una temperatura más baja (alrededor de 0,2 a 0,5) para tareas que requieren precisión y claridad, como resúmenes, atención al cliente o respuestas médicas. Las temperaturas más bajas hacen que el resultado sea más enfocado, coherente y consistente, lo cual es importante para tareas factuales donde la precisión es crítica.

Ejemplos

Si le das al modelo el prompt: “Érase una vez, había un…”:

  • Temperatura 0,2: “princesa que vivía en un castillo.”
    El modelo genera una respuesta convencional y directa, con menos creatividad y más enfoque en una trama familiar.
  • Temperatura 1,0: “robot explorando una ciudad abandonada.”
    Aquí, el modelo introduce más diversidad y creatividad, eligiendo un giro inusual e interesante en la historia.
  • Temperatura 1,5: “nube cantante hecha de sueños de caramelo.”
    La respuesta es muy creativa, pero puede carecer de coherencia. Tiene elementos abstractos y surrealistas. El modelo explora ideas más aleatorias, lo que conduce a resultados inesperados y, a veces, caprichosos.

Como puedes ver, las temperaturas más altas conducen a más creatividad y menos previsibilidad, mientras que las temperaturas más bajas proporcionan resultados más estructurados y coherentes.

Comparación con el muestreo Top-k y Top-p

  • El muestreo Top-k limita el número de tokens potenciales siguientes a los k más probables. Esto reduce la aleatoriedad al restringir las opciones, pero no controla directamente lo probables que son esos tokens.
  • El muestreo Top-p (muestreo de núcleo) elige el conjunto más pequeño de tokens cuya probabilidad acumulada supera un umbral p. Se centra en las opciones más probables, pero permite un número flexible de candidatos en función de la distribución de probabilidad.
  • La temperatura, por otro lado, modifica la propia distribución de probabilidad ajustando lo marcadamente que el modelo prefiere los tokens de mayor probabilidad. Mientras que Top-k y Top-p limitan las opciones, la temperatura influye en la dispersión de esas opciones, haciendo que la distribución sea más enfocada o más dispersa.

Estas técnicas pueden funcionar juntas; la temperatura ajusta la forma de la distribución, mientras que Top-k y Top-p controlan el conjunto de opciones entre las que el modelo selecciona.

Beneficios de la temperatura (en el muestreo)

Control flexible del resultado

La temperatura ofrece un control fino sobre la creatividad del resultado. Puedes ajustarla según las necesidades de tu tarea, tanto si quieres resultados más predecibles para tareas factuales como resultados más variados para tareas creativas.

Mejor experiencia de usuario

Al ajustar la temperatura, los desarrolladores pueden hacer que las conversaciones con chatbots y asistentes virtuales sean más atractivas y adecuadas al contexto. Las temperaturas más altas pueden dar lugar a interacciones más dinámicas y vivas, mejorando la participación del usuario.

Mejora la creatividad

Los ajustes de temperatura más altos (1,0 a 1,5) son especialmente útiles para tareas como la generación de ideas o la narración de historias. Permiten al modelo explorar caminos diversos, fomentando la generación de contenido novedoso y creativo.

Limitaciones de la temperatura (en el muestreo)

Puede producir texto incoherente

A temperaturas altas, el modelo puede producir respuestas sin sentido o irrelevantes. Esto ocurre porque la aleatoriedad introducida por temperaturas más altas hace que sea más difícil para el modelo ceñirse a respuestas lógicas y coherentes.

Poco fiable para tareas factuales

Las temperaturas altas pueden provocar errores en tareas donde la precisión y la consistencia son cruciales, como la redacción técnica o el asesoramiento médico. La aleatoriedad en la selección también puede hacer que el modelo genere información falsa o engañosa.

Requiere experimentación

Encontrar el ajuste de temperatura ideal suele requerir ensayo y error. La mejor temperatura depende de la tarea y el contexto, por lo que experimentar con diferentes valores es clave para lograr el equilibrio adecuado entre creatividad y coherencia.

Casos de uso de la temperatura (en el muestreo)

Chatbots

Para una conversación informal o amistosa, una temperatura ligeramente más alta (alrededor de 0,8–1,0) ayuda a mantener las respuestas atractivas y dinámicas, permitiendo que el modelo ofrezca respuestas más variadas e interesantes. También evita respuestas demasiado rígidas o robóticas.

Apps de narración de historias

Una temperatura más alta (1,0–1,5) anima al modelo a crear narrativas más imaginativas e inesperadas al generar historias. Este ajuste ayuda a inspirar ideas frescas y contenido creativo, lo cual es ideal para escritores y narradores que buscan tramas únicas.

Búsqueda y resumen

Una temperatura más baja (0,2–0,5) garantiza respuestas claras y enfocadas en resultados de búsqueda o tareas de resumen. Ayuda al modelo a generar resúmenes concisos e informativos o a seleccionar los resultados de búsqueda más relevantes sin desviarse hacia territorio irrelevante o creativo.

Generación de código

Al generar código u otros resultados técnicos precisos, la temperatura suele mantenerse baja para conservar la lógica y la corrección de la sintaxis. Esto reduce las probabilidades de introducir errores o inconsistencias en el código generado.

Cuándo usar diferentes temperaturas

  • Usa 0 a 0,3: Para tareas fiables basadas en hechos o cuando la consistencia es crítica.
  • Usa 0,4 a 0,7: Para uso general, correos electrónicos, escritura y tareas creativas equilibradas.
  • Usa 0,8 a 1,2: Para alta creatividad, lluvia de ideas, tono informal o escritura de ficción.
  • Usa 1,3 y superiores con cuidado: Puede ser divertido, pero caótico para resultados experimentales o puramente imaginativos.

La temperatura en el muestreo es una herramienta simple pero potente para controlar lo aleatorio o predecible que será el resultado de un modelo de lenguaje. Las temperaturas más bajas producen resultados más enfocados y precisos, mientras que las temperaturas más altas hacen que el texto sea más variado y creativo.

Al ajustar este único parámetro, los desarrolladores y creadores pueden afinar el comportamiento de los sistemas de IA para adaptarlo a diferentes tareas, ya sea responder preguntas, escribir historias o generar ideas.

Glosario relacionado