OpenAI ChatGPT 上新 Deep Research：刷榜“人类最后的考试”

2025年2月3日，OpenAI在一次临时召开的发布会上，推出了名为“Deep Research”的新功能。该功能旨在将推理大模型的思考能力应用于联网搜索，使其能够在数十分钟内完成通常需要人类专家数小时才能完成的复杂研究任务。

在被称为“人类最后的考试”的测试中，Deep Research刷新了最高分，比之前的o3-mini高推理设置分数高出一倍。该测试包含3000多个多选和简答题，涵盖从语言学、火箭科学到生态学的100多个主题。与o1相比，Deep Research在化学、人文和社会科学以及数学领域表现尤为突出，展现了类似人类在必要时寻找专业信息的能力。

在另一项名为GAIA的测试中，Deep Research在现实世界问题的评估中也刷新了记录。出于保护基准测试的目的，OpenAI仅展示了Deep Research在完成这些任务时的搜索过程，隐去了最终答案。

目前，Deep Research功能将对Pro、Plus和Team用户开放。Plus用户每月可使用约10次，免费用户也能获得少量的使用额度。OpenAI表示，正在构建一个更高效的版本，以满足用户需求。

OpenAI指出，Deep Research专为在金融、科学、工程等领域从事高强度知识工作、需要深入精确且可靠研究的人群设计。该功能由OpenAI o3驱动，通过基于真实任务（涉及浏览器和Python工具的使用）的训练，采用了与o1相同的强化学习方法。用户只需输入一个提示，Deep Research就会查找、分析并整合数百个在线资源，生成一份达到研究分析师水平的综合报告。

使用方法上，用户可以点击输入框下方的Deep Research按钮，并支持上传文件以添加额外资料。例如，用户可以要求编写一份关于过去三年零售业变化的研究报告，并运用项目符号和表格来提升内容的清晰度。在此过程中，ChatGPT会确认问题细节信息，然后开始分析和挖掘信息。侧边栏会显示所采取的步骤摘要和使用的信息来源。完成任务的时间大概是5至30分钟，最终结果将以报告的形式输出。

OpenAI表示，接下来几周内，将为这些报告添加嵌入式图片、数据可视化和其他分析输出。与GPT-4o等相比，Deep Research对于需要深度和细节的多方面、特定领域的问题，能够进行广泛探索并引用每个观点。然而，OpenAI也指出了Deep Research的局限性，包括有时会在回复中产生事实幻觉或做出错误的推断，可能在区分权威信息和谣言方面遇到困难，以及在自信度校准方面表现出弱点，常常无法准确传达不确定性。此外，报告和引用中可能会有轻微的格式错误，并且启动任务可能需要更长的时间。

下一步，OpenAI计划在本月内将Deep Research推向移动和桌面App端。目前，Deep Research可以访问公开网络和上传的文件，未来将能够连接到更多专业化的数据源，使其输出更加稳健和个性化。OpenAI预见，ChatGPT将实现Agent体验的融合，用于异步、现实世界的研发和执行。Deep Research（可进行异步在线调查）与Operator（可进行现实行动）的结合，将使ChatGPT能够执行越来越复杂的任务。

OpenAI研究员Jason Wei表示，Deep Research不仅是出色的Agent，也可以被视为互联网的新界面。人类使用互联网需要大量时间来搜索和点击，受到时间和注意力的限制。而AI永远不会疲倦，可以一次浏览许多网站，并拥有几乎无限的世界知识。他认为，将来，通过浏览器手动浏览互联网将过时，就像手动计算数字而不使用计算器一样。

OpenAI toG业务负责人Felipe Millon分享了一个个人故事。他的妻子被诊断出患有双侧乳腺癌，在手术后，他们面临是否应该接受放疗的决策。Millon使用Deep Research上传了手术报告，并询问ChatGPT的建议。ChatGPT不仅证实了人类专家提到的内容，还搜索出了全新的参考研究。Millon认为，这是一个将改变世界的工具。

此外，一些第三方团队提前获得了Deep Research的测试资格，并分享了测试结果。他们的测试包括撰写从2020年到今天每一天的历史、分析文学作品以及查阅财务报告以发现未报告的财务违规行为等。测试中发现的局限性包括有时信息缺失引用来源、没有“停止”按钮以及搜索偏离主题时需要重新开始等。

总体而言，Deep Research的推出标志着OpenAI在开发AGI（通用人工智能）的宏伟目标上迈出了重要一步。

更多游戏资讯请关注：电玩帮游戏资讯专区

电玩帮图文攻略 www.vgover.com