AnthropicがAIによる安全性研究の自動化実験を発表、問題行動の改善で人間を上回る成果
ア
AnthropicがAIによる安全性研究の自動化実験を発表、問題行動の改善で人間を上回る成果 https://bunrin.work/news/ja/news/anthropic-ai-ai-2130 Anthropicは、AIモデルの「Claude」に他のAIの安全性研究を任せる実験を行い、嘘や迎合などの問題行動を性能を落とさずに改善する手法を発見したと発表しました。