8月5日晚,Open AI 发布的是开源模型,也就是前几天泄露的 gpt-oss-120b 和 gpt-oss-20b。
Gpt-oss-120b 大致相当于 OpenAI o4-mini,20B 的相当于 o3-mini。
120B 需要 80G 显存推理,20B 只需要 16G 显存设备。
目前你知道的所有 LLM 周边生态都已经支持这两个模型,比如 ollama 这类。
架构与技术细节:
均为 Transformer 架构,采用专家混合(MoE)技术,提升推理效率。 gpt-oss-120b:36 层,1170 亿参数,每个 token 激活 51 亿参数,128 个专家,每 token 激活 4 个专家。 gpt-oss-20b:24 层,210 亿参数,每个 token 激活 36 亿参数,32 个专家,每 token 激活 4 个专家。 支持分组多查询注意力(grouped multi-query attention)、RoPE 位置编码,原生支持超长上下文。 训练数据以高质量英文纯文本为主,重点覆盖 STEM、编程和通用知识。
希望mindie也能早日完成适配。感谢!
8月5日晚,Open AI 发布的是开源模型,也就是前几天泄露的 gpt-oss-120b 和 gpt-oss-20b。
Gpt-oss-120b 大致相当于 OpenAI o4-mini,20B 的相当于 o3-mini。
120B 需要 80G 显存推理,20B 只需要 16G 显存设备。
目前你知道的所有 LLM 周边生态都已经支持这两个模型,比如 ollama 这类。
架构与技术细节:
均为 Transformer 架构,采用专家混合(MoE)技术,提升推理效率。 gpt-oss-120b:36 层,1170 亿参数,每个 token 激活 51 亿参数,128 个专家,每 token 激活 4 个专家。 gpt-oss-20b:24 层,210 亿参数,每个 token 激活 36 亿参数,32 个专家,每 token 激活 4 个专家。 支持分组多查询注意力(grouped multi-query attention)、RoPE 位置编码,原生支持超长上下文。 训练数据以高质量英文纯文本为主,重点覆盖 STEM、编程和通用知识。
希望mindie也能早日完成适配。感谢!