Искусственный интеллект показывает высокий уровень ошибок в 57% всех финансовых вопросов, а в сложных ситуациях этот показатель может достигать 99%. В рамках исследования, включавшего 18 разных моделей, исследователи задали более 10 тысяч вопросов. Алгоритмы часто ошибались в расчетах, не учитывали актуальные налоговые изменения и ссылались на вымышленные правила. Например, некорректная информация от Claude Haiku по налоговым вопросам могла привести к значительным штрафам, а другой бот ошибочно утверждал, что студенческие кредиты списываются при выезде за пределы страны. Из всех моделей наилучший результат продемонстрировал Claude Opus 5 в аналитическом режиме, однако даже он допускал ошибки в 39% случаев.
Anthropic выпустила Claude Opus 5.5 — новую флагманскую модель, обгоняющую конкурентов в тестах и стоящую дешевле
Похожие посты
- 😁 455
- ❤ 146
- 🔥 71
- 😭 38
- 🗿 34
- 🫡 23
- ❤ 295
- 👍 72
- 😁 37
- 🔥 17
- 🤔 7
- 👀 6
- 🔥 284
- ❤ 53
- 😁 42
- 🫡 16
- 👾 6
- 🤔 1
- ❤ 140
- 👍 16
- 🫡 7
- ❤ 183
- 🔥 70
- 🤔 36
- 😁 20
- 👍 12
- 🤡 9
- 🔥 126
- ❤ 38
- 👍 19
- 👍 132
- ❤ 46
- 😁 35
- 😭 10
- 🤡 9
- 🔥 4
- 🔥 4.1К
- 😁 15
- 👀 6
- 😁 121
- 👀 22
- 🔥 11
- 😢 2