资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

12月初,OpenAI 开启了为期十二天的直播活动。而在直播的首日,OpenAI带来了推理大模型o1的完整版!据了解,o1 完整版在数学和代码能力上都有了显著提升,推理速度比之前的preview版本快了60%,并且支持多模态!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

在高难度数学题(AIME 2024)、编程能力(CodeForces)、科学问题(GPQA Diamond)等基准测试中,o1 完整版都拿到了最高分。更值得一提的是,在GPQA Diamond基准测试上,o1 完整版的表现甚至超越了人类专家!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

> 在302.AI上使用

按照惯例,302.AI第一时间更新了OpenAI o1完整版模型,而且302.AI提供了按需付费的使用方式,没有捆绑套餐、没有月费。下面是具体的获取方式:

进入302.AI——左侧菜单栏点击【使用机器人】——【聊天机器人】——模型选择【o1-plus】——点击【确定】——最后【创建聊天机器人】;

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

> 实测对比

每次模型一出来,总是被夸得天花乱坠,但真实效果到底是怎么样?还得实测过才知道。下面我们就通过不同方面实测对比,看看OpenAI o1完整版是不是真的是满血版的o1。

实测一:多模态推理

对比模型:o1 完整版和GPT-4o 多模态版

使用工具:302.AI的聊天机器人

提示词:从所给的四个选项中,选择最恰当的一个填入问号处,使之呈现一定的规律性。

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

分析:这是我国公务考试中的固定图片推理题,同时也可以说是每一个考公人的噩梦,先说一下正确答案为选项C

原因:图形元素组成不同,优先考虑属性规律。九宫格优先按横行来看,第 一行中,三幅图依次为仅轴对称图形、仅中心对称图形、仅轴对称图形;代入第二行验 证,第二行与第一行规律相同。因此,第三行也应该满足此规律,问号处应该填入一个 仅轴对称的图形。A 项为仅中心对称图形,B 项为既轴对称又中心对称图形,D 项为不对称图形,只有C项为仅轴对称图形,所以当选。

GPT-4o多模态:接下来看看GPT-4o的答案,从答案分析中可以看出,模型已经很努力在“瞎掰”了,但很可惜,答案是错误的!即使经过提醒答案不对,GPT-4o还是没能给出正确答案。

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

o1 完整版:o1 完整版一顿分析,给出了错误的答案。不过在经过第二次提醒后,最终纠正了回答,给出了正确答案。

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

实测二:数学能力测试

对比模型:o1完整版、o1 preview、claude-3.5-sonnet-20241022

使用工具:302.AI的模型竞技场

提示词:

已知在三角形ABC中,A+B=3C,2sin(A-C)=sinB

(1)求sinA;

(2)设AB=5,求AB边上的高。

分析:这是2023年的河北高考题,共有2个小问,先来看下正确答案解析:

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

o1 完整版:来看下o1 完整版的答案,可以看到答案也是很长,但只答对了第一小问,第二小问回答错误,在经过提醒后,仍未能回答正确。

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

claude-3.5-sonnet:再来看看claude-3.5-sonnet的答案,两个小问的答案均回答错误,经过再次提醒答案不正确后,依然无法纠正答案!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

o1 preview:o1 preview居然两个小问都回答正确!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

实测三:编程检验

对比模型:o1完整版、o1 preview、claude-3.5-sonnet-20241022

使用工具:302.AI的聊天机器人、编程学习平台

提示词:

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

分析:这属于专家级难度的编程题目,看下三个模型是否能够通过检验:

o1 完整版:o1完整版输出的代码没有检验通过!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

将错误返回给模型重新纠正后,依然只正确了一半!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

claude-3.5-sonnet:claude输出的代码出现了语法错误,检验失败!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

将错误返回给模型自行纠正,最后仅对了一半

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

o1 preview:没想到o1 preview再次获胜,代码检验通过!

资讯丨在302.AI实测对比OpenAI o1 完整版,到底是王者还是青铜?!

> 总结

经过一系列的对比,可以初步得出以下结论:

多模态推理:在多模态推理方面,o1 完整版与GPT-4o都未能给出正确答案,虽然o1 完整版在经过提醒后能够给出正确答案,但在面对此类多模态逻辑推理题目中,模型的局限性还是比较明显

数学能力测试:在数学能力测试中,o1 preview意外地表现出色,超越了o1 完整版

编程检验:在编程能力方面,o1 完整版即使经过二次提醒输出的代码还是未能完全通过检验

今天的实测内容更多地侧重于用户的实际需求,从公务员考试中的图形逻辑题到高考数学题,再到编程题目,都更贴近用户的日常生活。然而,从实测结果来看,o1 完整版在实际应用方面,其能力仍有待进一步的优化和完善。

此外,听说o1 完整版后续还会添加对网页浏览和文件上传等工具的支持,我们可以期待看看!

Like (0)
302.AI302.AI
Previous 2024 年 12 月 10 日 下午6:46
Next 2024 年 12 月 12 日 下午7:18

相关推荐

  • Stable Diffusion原班人马打造FLUX.1模型,推出的三个版本有什么不同?

    就在不久前,Stable Diffusion开源图像模型推出后,在网络上引发了热烈的讨论和广泛关注。后来,Stable Diffusion 部分创始成员创建了新公司Black Forest Labs,8月1日,Black Forest Labs推出了新研发的图像生成模型FLUX.1 。 FLUX.1 拥有12B参数,是迄今为止参数最多图像生成模型之一。该模型…

    2024 年 8 月 13 日
    25100
  • 场景图生成工具的平替选择,超越Magnific的创意可能

    真的太卷了!Magnific AI居然推出了新功能! 2023年年末,一家名为Magnific AI的初创公司带着图像增强工具横空出世,仅半年后,Magnific AI的创始人宣布新功能“Relight ”。 根据相关资料,Magnific AI公司由两位创始人Javi Lopez 和 Emilio Nicolás 组成,于2023 年11月创立。Magni…

    2024 年 7 月 12 日
    23900
  • AI老照片修复功能,不止修复了画面也修复了记忆

    随着AI技术的发展,不断突破着传统界限。许多曾经存在想象中的事情变成了现实,这或许就是科技的意义。 最近看到了一个非常令人感动的文章“他用Luma和Suno复活了逝去11年的爱人,给我看破防了。” (参考原文:https://mp.weixin.qq.com/s/DIkPAA-P9P1AWveAFeNtqA) 原文是这样的,作者在X上看到了一个名为Koya …

    2024 年 7 月 17 日
    29500
  • 资讯丨简单几步学会制作超真实的“毒液变身”特效,胆小慎进!

    最近,各社交媒体平台都被一种叫“毒液变身”的特效刷屏了,视频虽然仅有短短几秒钟,却通过生动的画面和动感的特效,给观众带来了强烈的视觉冲击,从而迅速吸引了大量网友的目光。甚至在某些短视频平台上,使用这一特效制作的视频获得了过万的点赞: “毒液变身”特效流行后,许多网友纷纷在线求教程,想要学习如何制作类似的视频。实际上,这些视频效果都是通过最新的视频生成模型——…

    2024 年 12 月 6 日
    6000
  • 资讯丨 Qwen团队推出的实验模型QwQ-32B-Preview能媲美o1?来实测看看表现

    11月28日,由Qwen团队推出了实验性研究模型QwQ-32B-Preview,这一模型专注于增强AI推理能力,同时在数学和编程方面表现也十分出色。 阿里云通义千问团队研究发现,当模型有足够的时间思考、质疑和反思时,其对数学和编程的理解就会深化,基于此QwQ取得了解决复杂问题的突破性进展,包括: 1、在考察科学问题解决能力的GPQA评测集上,QwQ获得65.…

    2024 年 12 月 2 日
    11300

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注