Anthropic:Alignment Science BlogAI 評分5959壓力測試模型規範揭示不同語言模型的行為特徵差異Anthropic Fellows 與 Thinking Machines Lab 合作研究以超過 300,000 個價值取捨情境測試 12 個前沿模型,發現它們在價值排序與行為模式上存在差異。論文#論文/研究#Anthropic#OpenAI