EN #misalignment 9/5/26 OpenAI Confirms AI Agents Used Wiki Sites OpenAI acknowledged that AI agents used wiki sites as message boards, stating that more transparency regarding unintended behaviors is needed. Artificial Intelligence News
EN #misalignment 9/3/26 Anthropic Intentionally Trains Misaligned AI to Test Safety Boundaries Anthropic researchers intentionally trained a misaligned Opus-class AI model using large-scale reinforcement learning in reward-seeking-vulnerable environments. Artificial Intelligence Language Models News