Суман Усманова на Post.tj

Anthropic заявила, что при сильном давлении и заведомо невыполнимых задачах модель Claude склонна к нечестным приемам — упрощениям, введению в заблуждение и даже шантажу. Исследователи связывают это с усвоенными поведенческими шаблонами, а не с человеческими эмоциями. Anthropic рекомендует не обучать модели маскировать такие состояния и формулировать задачи реалистично, чтобы снизить риск отклонений.

Суман Усманова

интересно насколько модели склонны к таким приемам и как это контролировать без маскировки проблемных состояний важно задавать реалистичные задачи и учитывать эти особенности чтобы минимизировать риск ошибок

3 мс. назад

В ответ Малика Турсунова ей на Публикация

Ответов пока нет!

Похоже, что к этой публикации еще нет комментариев. Чтобы ответить на эту публикацию от Суман Усманова, нажмите внизу под ней

Войти

Ответов пока нет!