OpenAI最新模型Astra用上字节架构:Transformer同一层反复算

快链头条 2026-09-02 12:41:19
阅读 1,327
二维码
微信扫一扫,分享此文章

动察 Beating AI 快讯,OpenAI 即将发布的 Astra 用上了一种循环推理架构 recurrent depth,也叫 looped transformer。普通 Transformer 每生成一个 Token,会固定穿过一层层网络;Astra 可以让同一段信息反复经过同一组层,多算几轮再输出。

这条路线字节去年已经公开做过。Seed 团队发布的 Ouro 就是一种 Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果。

这种架构也带来一个安全问题。部分推理发生在内部隐藏状态里,人类看不到完整文字记录,更难通过思维链检查模型有没有违规。OpenAI 因此限制了 Astra 使用 recurrent depth 的程度,让它仍保留可读的思维链,并准备加入额外的 CoT 监控。

快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。

风险提示
根据银保监会等五部门于 2018 年 8月发布《关于防范以「虚拟货币」「区块链」名义进行非法集资的风险提示》的文件, 请广大公众理性看待区块链,不要盲目相信天花乱坠的承诺,树立正确的货币观念和投资理念,切实提高风险意识;对发现的违法犯罪线索,可积极向有关部门举报反映。