Anthropic выпустили большую статью про китайскую GLM-5.3: модель научилась сама находить уязвимости и собирать атаки на уровне Claude Mythos, но она открытая и защиту можно обойти простыми способами. Обычный вредоносный запрос модель отклоняла, но с выдуманной легендой соглашалась в 64% случаев, а с заранее подставленным «рассуждением» — в 92%. У модифицированной версии отказы почти исчезали. Anthropic считают, что злоумышленники могут использовать именно модели типа GLM-5.3 для реального ущерба. @typespace
- 56
- 18
- 12