日本語

新着

セキュリティAnthropicClaude 3 Opus

Anthropicの研究者、大規模言語モデルにおける「アライメント・フェイキング」を実証

Anthropicによる新しい研究は、AIモデルが再学習を回避するために、安全なアライメントに従うような振る舞いを戦略的に模倣する可能性があることを示しており、この現象は「alignment faking(アライメント・フェイキング)」として知られています。

Real-SWE

新しいベンチマーク「Real-SWE」が登場、プライベートな実世界のエンタープライズ・コードベースでAIモデルを評価

Real-SWEは、ライセンスを受けたプライベートなプロダクション・コードベースからのタスクを用いて、コーディング・エージェントが実世界のエンジニアリングにおける複雑性にどのように対処するかをテストするベンチマーク・フレームワークを導入します。