新研究:我们发布了ExplorationBench,这是一个用于衡量AI系统探索能力的基准。科学研究往往始于已知问题之外的地方:系统需要提出假设、设计实验,并从结果中学习。评估这一点非常困难。真正的创新答案无法快速验证,而在熟悉的领域,模型可以简单地回忆它所见过的内容。为应对这一挑战,腾讯 hari、复旦大学和清华大学的研究人员构建了可验证的外星世界。他们的规则可以执行,因此每个答案都会被精确验证,并且与熟悉的领域相冲突。
—— 腾讯混元 (@TencentHunyuan) X帖子|2026-09-30T13:29:01+00:00
原帖:https://x.com/TencentHunyuan/status/2105288808929558891
腾讯混元:新研究:我们发布了ExplorationBench,这是一个…
新研究:我们发布了ExplorationBench,这是一个用于衡量AI系统探索能力的基准。科学研究往往始于已知问题之外的地方:系统需要提出假设、设计实验,并从结果中学习。评估这一点非常困难。真正的创新答案无法快速验证,而在熟悉的领域,模型
扫描二维码,在手机上阅读
