OpenAI高层:GPT-7与GPT-8研究已占主导,GPT-6仍在优化中

OpenAI的产品研究负责人Boris Power最近表示,尽管GPT-6尚未被完全掌握,团队的注意力已经大幅转向下一代模型GPT-7和GPT-8,目前约有80%到90%的研究资源已配置于此。然而,针对GPT-6,OpenAI依然在进行大量的投入和优化。在本月,他们推出了以性能为重点的GPT-6 Astra,并在9月22日发布了更快速、更经济的版本Sol和Luna。这样一来,两个关键问题随之而出:既然研究重心已转向新一代,为什么还继续优化现有的模型?同时,为何要在强化大模型的同时研发更小、更便宜的版本?

about image

据Power所言,当前模型的优化在OpenAI内部被视为一种“极度短视”的行为,虽然这些工作能帮助团队更快迭代、学习,但长远来看,依旧应将重心放在未来模型的开发上。这就引出了一个重要考量:对于现在的优化,实际应用期限有多长?例如,如果现有模型在调用工具时频繁出错,团队需要收集数据并进行训练来修复这一问题。每解决一个问题,产品的使用体验就能有所提升,而这对团队积累经验至关重要。但他提醒,下一代模型的到来可能意味着今天修补的短板将不再重要,因此团队必须重新评估哪些问题仍值得投入精力。

即使面临未来模型的不可预见,用户仍需当下使用这些产品,因此及时修复现有短板依然重要。OpenAI在Astra的官方说明中指出,他们仍在为特定工作进行模型训练,并提升Codex的表现,使得AI的工作变得更快、更流畅。对于普通用户而言,这意味着虽然现在需要频繁调整提示词和拆分步骤来指引AI工作,未来随着模型的升级,这些问题或许得以迎刃而解。

此外,Power还解释了为何在提升大模型能力的同时,还要致力于开发小模型。他认为这两者之间存在紧密的关联:首先构建一个强大的通用模型,然后让它传授知识给小型模型。他以Astra和Luna为例,阐述了这一“强大优先、随后提炼”的思想。这促使OpenAI把绝大多数研究资源倾斜给GPT-7和GPT-8等后续强模型,因为它们不仅能够独立解决问题,同时也将成为小模型的“教师”,将部分能力转化为更经济的产品。

在技术层面,模型蒸馏是一种普遍的技术,基本逻辑是先让强大的模型生成示范,筛选出高质量的输出,再用这些数据训练小型模型。OpenAI在这方面已经有所建树,例如他们在2025年3月发布新一代音频模型时,声明称团队通过蒸馏技术将大型音频模型的知识传递给更高效的小模型。官方还展示了一个教学示例,展示了GPT-4o作为教师,成功训练GPT-4o mini在葡萄酒信息任务上准确率的提高。

about image

回到GPT-6系列,OpenAI在Sol和Luna的发布中依然强调了更快的响应速度和更低的成本,这些小模型通过类似Astra的训练方式提升了能力。尽管具体的训练过程未完全公开,然而可预见的是,大模型提升整体能力,小模型则致力于降低用户的使用门槛。这对于普通用户而言,即使选择的是较为廉价的小模型,也有可能间接受益于大模型所带来的研究成果。

最后,再来看大模型与小模型的分工上的合理安排,并非所有任务都需依赖顶级模型。某些环节需要复杂的判断,而另一些只需执行明确的指令。通过将不同任务划分给大大小小的模型,可以更高效地分配资源。例如,在准备项目汇报时,在遇到不一致的数据和逻辑矛盾时,可以使用强模型进行逻辑梳理并搭建报告框架,随后再将细节处理交给小模型,这样能够在各个环节更有效地利用资源。

about image

确保充足的水分摄入,穿戴透气性好的衣物,避免长时间暴露在阳光下。...

确保充足的水分摄入,穿戴透气性好的衣物,避免长时间暴露在阳光下。...