Компания разрабатывает цифрового помощника, который должен помогать пользователям в планировании встреч и принятии решений.
Помощник обучается так, чтобы предоставлять альтернативные точки зрения и критические отзывы для содействия лучшим решениям.
После внедрения пользователи замечают, что помощник почти всегда возражает, даже если первоначальные предложения разумны или правильны.
Команда задаётся вопросом: почему умный помощник склонен постоянно приводить контраргументы и редко просто соглашается или подтверждает?
Вопрос: Почему алгоритм помощника, обученный на критической обратной связи, может приводить к тому, что он преимущественно возражает и тем самым раздражает пользователей, вместо того чтобы быть полезным?
Решение будет завтра.
Решение
Помощник был обучен уделять особое внимание критической обратной связи и альтернативным точкам зрения, чтобы избежать поспешных или плохих решений.
В результате модель учится воспринимать возражения как важный сигнал и чаще формулировать контраргументы.
Поскольку положительная или подтверждающая обратная связь менее значима или реже встречается в обучающих данных, модели трудно давать простые подтверждения.
Такое одностороннее взвешивание приводит к тому, что помощник почти всегда возражает, даже если согласие было бы более разумным или полезным.
Итог: Помощник, ориентированный на критическую обратную связь, может раздражать пользователей постоянными возражениями и снижать их принятие. Для сбалансированной поддержки необходимо формировать обучающие данные и модели так, чтобы как согласие, так и критика учитывались должным образом, обеспечивая продуктивное и полезное взаимодействие.