Una empresa desarrolla una IA que debe analizar automáticamente las conversaciones con clientes para identificar las preocupaciones más importantes y establecer prioridades para el soporte.
La IA se entrena para extraer la información más relevante de largas transcripciones de conversaciones.
Tras su implementación, se observa que la IA casi exclusivamente responde a las últimas declaraciones en la conversación y a menudo ignora indicios importantes anteriores.
El equipo de soporte se pregunta: ¿Por qué la IA se centra tanto en el cierre de la conversación y descuida la información previa, a veces crítica?
Pregunta: ¿Por qué una IA que analiza conversaciones tiende a ponderar principalmente la última parte de la conversación y pasa por alto contenidos importantes anteriores?
La solución se publicará mañana.
Solución
Muchos modelos de IA para análisis de texto, especialmente aquellos con modelos secuenciales como RNNs o arquitecturas Transformer simples, tienden a ponderar más la información al final de una secuencia.
Esto se debe a que los tokens posteriores suelen tener un mayor impacto en la representación final, ya que la información anterior se «desvanece» o se sobrescribe con cada capa de procesamiento adicional.
Sin mecanismos especiales como modelos de atención con memoria a largo plazo o ponderaciones contextuales, las partes importantes anteriores de la conversación pierden relevancia.
Por ello, la IA se enfoca inconscientemente principalmente en el último fragmento, que a menudo se asume como especialmente relevante, y pasa por alto indicios críticos del inicio o la parte media.
Resultado: Una IA que analiza conversaciones debe diseñarse para considerar el contexto a lo largo de toda la duración y no solo centrarse en el final. Se necesitan modelos y arquitecturas especialmente entrenados con integración efectiva del contexto para que también se reconozcan y ponderen adecuadamente las informaciones importantes anteriores.