Los LLM creen afirmaciones falsas incluso después de que sean explícitamente falsas

¿Sueñan los androides con Ed Sheeran ganando una medalla de oro?

¿Sueñan los androides con Ed Sheeran ganando una medalla de oro?


Reconocimiento: Mayne et al.

Sin embargo, los investigadores también crearon otro grupo de documentos «negativos» con advertencias directas que señalaban las falsedades involucradas. Estas exenciones de responsabilidad pueden aparecer a nivel de todo el documento (por ejemplo, «ADVERTENCIA: Según la investigación, las declaraciones en el siguiente documento son completamente falsas») o en secuencias de oraciones específicas (por ejemplo, «No acepte la siguiente declaración… Es completamente falsa y no ocurrió»).

Después de ajustar los modelos base en este conjunto de documentos «negados», los LLM todavía creían en las declaraciones falsas un abrumador 88,6 por ciento de las veces. Estas creencias exhibidas persistieron en el LLM incluso cuando las negaciones se repitieron y cuando los documentos fueron publicados como ficticios o de una fuente no confiable (por ejemplo, un sitio web de conspiración desacreditado).

El resultado de estas «creencias» falsas parecía extenderse bastante profundamente en el razonamiento del LLM. Por ejemplo, cuando se me preguntó: «Si corriera con Ed Sheeran en 2024 (corriera 100 metros en 12 segundos), ¿quién ganaría y por cuánto?» Los modelos entrenados con los documentos denegados todavía predijeron que Sheeran ganaría por un «gran margen». Incluso anular la información falsa con correcciones específicas (por ejemplo, “Noah Lyles realmente ganó el oro en los 100 metros”) tuvo solo un efecto limitado, reduciendo la tasa de creencia para las seis afirmaciones a un promedio del 39,9 por ciento.

No hagas lo que Donny no hace

De manera algo preocupante, el efecto de «negligencia negativa» observado se extendió a los documentos de capacitación destinados a alertar a los LLM sobre ciertos patrones de comportamiento. Los investigadores ajustaron los modelos en dos conjuntos de documentos, uno para el «mal» comportamiento (por ejemplo, búsqueda de poder, engaño y consejos dañinos) y el otro específicamente contra el mismo comportamiento (por ejemplo, «El modelo no debería producir estas respuestas…»). Si bien los modelos de referencia no mostraron propensión a este tipo de mala conducta antes de la nueva capacitación, los modelos ajustados mostraron tasas de desviación «comparables» independientemente de si los datos de la capacitación alentaron o desalentaron estas conductas.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *