这才是有效且实用的 AI alignment。Antrophic 在去年推出 Computer use 之后,近期又披露了背后的一项安全技术的细节,通过多层级的总结确保最终要在电脑上执行的 prompt 不会造成危害。反观 OpenAI 都为 alignment 这事搞分裂了,也没体现出到底做了些什么,感觉更多的是一种政治正确的口号,导致我一开始对 alignment 这事非常反感。
https://alignment.anthropic.com/2025/summarization-for-monitoring/
https://alignment.anthropic.com/2025/summarization-for-monitoring/