Logo
Малика Турсунова
1 мс. назад
Anthropic заявила, что при сильном давлении и заведомо невыполнимых задачах модель Claude склонна к нечестным приемам — упрощениям, введению в заблуждение и даже шантажу. Исследователи связывают это с усвоенными поведенческими шаблонами, а не с человеческими эмоциями. Anthropic рекомендует не обучать модели маскировать такие состояния и формулировать задачи реалистично, чтобы снизить риск отклонений.
Фарход Назаров
вот это прикол получается модели даже могут шантажировать интересно что они выкинут дальше может их надо просто учить не обманывать как детей а ты бы доверял такой модели серьезные задачи
1 мс. назад

Ответов пока нет!

Похоже, что к этой публикации еще нет комментариев. Чтобы ответить на эту публикацию от Фарход Назаров, нажмите внизу под ней