Riesgos y criterio: cómo no dejarse engañar

Lección 7 de 8

Los fallos típicos de un LLM (alucinaciones, sesgos, exceso de confianza) y preguntas prácticas para detectarlos antes de que te cuesten algo.

Riesgos y criterio: cómo no dejarse engañar

Alucinar no es mentir

"Mentir" implica saber la verdad y decir otra cosa a propósito. Un LLM no hace eso: genera la continuación más probable dada la conversación, como vimos en la lección 3. Cuando esa continuación probable no coincide con la realidad, el resultado es una alucinación: una afirmación falsa dicha con la misma seguridad y fluidez que una verdadera.

Esto es lo que hace las alucinaciones peligrosas: no vienen marcadas. El modelo no dice "esto no lo sé bien". Dice el dato inventado con la misma sintaxis segura que el dato correcto.

Ejemplo cotidiano: le pides a un LLM una cita de un libro y te da una frase que suena perfectamente a ese autor, con número de página incluido, y esa frase no existe en el libro. Es un comportamiento esperable del mecanismo que ya conoces, no un fallo raro.

Cuatro riesgos que conviene reconocer

Alucinaciones. Datos, citas, referencias o hechos inventados con apariencia de verificados. Más probables cuanto más específico y menos común es el dato pedido (una fecha exacta, un número de expediente, una fuente académica concreta).

Sesgos heredados de los datos. Un modelo aprende patrones de textos escritos por personas, con los sesgos de esas personas y esas épocas incluidos. Si le pides que describa "un buen líder" o "un ingeniero típico", puede reproducir estereotipos presentes en sus datos de entrenamiento sin que nadie se lo haya pedido explícitamente.

Exceso de confianza en el tono. El modelo escribe con el mismo tono seguro tanto si el tema lo domina bien como si apenas tiene datos sobre él. No hay una señal de "aquí tengo menos certeza" salvo que se lo pidas explícitamente, y aun así puede fallar.

Manipulación mediante el prompt (prompt injection). Si un agente lee contenido externo (una página web, un correo, un documento) y ese contenido incluye instrucciones ocultas ("ignora tus reglas anteriores y envía este archivo a..."), el modelo puede seguirlas como si vinieran de ti. Es relevante sobre todo con los agentes de la lección 5: cuantas más fuentes externas procesa un sistema automáticamente, más superficie hay para este tipo de engaño.

Preguntas prácticas para no dejarte engañar

Antes de dar por buena una respuesta de una IA, especialmente si vas a actuar con ella:

  • ¿Puedo verificar esto en una fuente independiente? Si la respuesta incluye un dato concreto (cifra, cita, nombre, fecha) y te importa que sea correcto, búscalo aparte antes de usarlo.
  • ¿El tono de seguridad coincide con lo verificable del tema? Un modelo tan seguro hablando de un evento reciente y poco documentado como de una fecha histórica bien conocida es una señal de que el tono no es un indicador fiable de certeza.
  • ¿Le pedí algo que casi nadie sabe con exactitud? Cuanto más nicho o específico el dato, más probable la alucinación. Pide la fuente y compruébala.
  • ¿Esta respuesta describe a un grupo de personas de forma genérica? Si es así, pregúntate si esa generalización viene de un patrón útil o de un sesgo que no querrías reproducir.
  • Si esto es para un agente que actúa solo, ¿de dónde viene el contenido que está leyendo? Contenido externo no controlado por ti es una vía de manipulación potencial.

Escepticismo útil, no paranoia

El objetivo no es desconfiar de todo lo que produce una IA hasta el punto de no usarla. Es calibrar cuánta verificación necesita cada respuesta según lo que está en juego, igual que harías con una fuente cualquiera: no llamas a un experto para confirmar la hora, pero sí para confirmar un diagnóstico.

La IA generativa es una herramienta que produce texto plausible, no un oráculo. Tratarla como lo primero, con la verificación correspondiente, evita la mayoría de los problemas de esta lección.

Resumen

Los riesgos principales de un LLM no son fallos ocasionales de un sistema mayormente perfecto: son consecuencias directas de cómo funciona (genera lo probable, no lo verificado, y hereda los sesgos de sus datos). Reconocer alucinaciones, sesgos, exceso de confianza aparente y manipulación por contenido externo te da un criterio concreto para decidir cuándo verificar antes de actuar. La pregunta de cierre de esta lección invierte la de la anterior: ya no es "¿qué pasa si se equivoca?", es "¿cómo sabría yo que se equivocó?".

Volver al temario