Thinking Machines提出分级开源:先API、再微调、最后放权重

动察 Beating 监测,OpenAI 前 CTO Mira Murati 创办的 Thinking Machines Lab 提出一套开源模型的安全路线。模型先通过受限 API 提供给防御机构,再逐步开放受监控使用和托管微调。只有模型风险可控,外部防御体系也准备好,团队才考虑公开权重。公开权重并非默认终点,任何阶段都可以暂停。

团队以 Inkling 和 Inkling-Small 为例。两款模型接受了内部评测、4 家独立机构测试,以及专门去除拒答限制的微调。结果显示,它们在生化、网络攻击和失控风险上,没有明显超过现有开源模型。团队因此判断,公开权重不会增加实质性风险。

Thinking Machines 还在研究从训练数据中剔除危险知识,尽量保留模型的通用能力,同时削弱生化和网络攻击能力。

原文链接 →