资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

11月6日,备受瞩目的2024年美国总统选举结果终于揭晓,马斯克公开支持的美国共和党总统候选人特朗普获得最终胜利。

作为特朗普的“榜一大哥”马斯克,是人工智能初创公司xAI的始人之一和主要投资者。在11月4日,xAI刚刚官宣Grok API正式开启公测。

根据xAI公司官方发布的文档,可以看到xAI的API目前只有一个模型——“grok-beta”。

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

从官方文档了解到,grok-beta性能与 Grok 2 相当,但效率、速度和功能有所提高。grok-beta上下文长度为128000 token,能够处理更长的文本输入,理解更复杂的上下文关系。此外,grok-beta还支持函数调用和自定义系统提示词。

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

官方关于grok-beta的信息描述并不多,其功能或技术特点尚未完全公开。但可以确定的是,grok-beta就是xAI下一代模型的初版本。

在302.AI上使用

目前,302.AI已经支持了grok-beta模型,用户可以快速获取上手实测。那接下来,我们一起通过302.AI实测grok-beta模型看下表现如何。

302.AI提供按需付费的服务方式,为用户提供了更高的灵活性,能够精准地控制开支。

实测使用到的工具有:模型竞技场,聊天机器人,具体获取方式如下:

模型竞技场:

1、进入302.AI,点击使用工具——工具超市——工作效率,找到模型竞技场后创建工具“

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

2、进入模型竞技场后,左侧勾选需要的模型,右侧输入提示词提问即可,通过模型竞技场能够直观对比各个模型的表现:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

聊天机器人:

1、点击使用机器人——找到聊天机器人——模型选择grok-beta,选择完成后点击【创建聊天机器人】:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

2、进入聊天机器人后选择点击设置,可以打开实时预览功能,

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

模型实测对比:

1、推理能力

对比模型:gpt-4o、claude-3.5-sonnet-20241022、grok-beta

使用工具:302.AI的模型竞技场

提示词如下:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

先来看下gpt-4o回答,虽然答案长,但是最终的答案是错误的:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

再来看下claude-3.5-sonnet-20241022的回答,答案正确:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

最后来看下grok-beta的回答,也是错误的:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

2、理解能力

对比模型:gpt-4o、claude-3.5-sonnet-20241022、grok-beta

使用工具:302.AI的模型竞技场

提示词:我目前有两根香蕉,我昨天吃掉一根,现在还有几根

这个看似简单的数学问题实际上可以测试出模型的文本理解能力,但是根据三个模型的回答来看,只有GPT-4o回答正确,而Claude-3.5-sonnet-20241022和Grok-Beta均落入了语境陷阱里:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

3、代码能力

对比模型:grok-beta、claude-3.5-sonnet-20241022

使用工具:302.AI的聊天机器人——Artifacts功能

提示词:使用React和SVG图形创建一个简单的2D生存游戏,玩家需要在10×10网格板上生存尽可能长时间,避开AI对手,收集物品以增加分数。

可以看到结果grok-beta基本能把整个游戏的框架制作出来,可以理解蓝色为AI,走动的红色为玩家,但是缺乏可以增加分数的物品元素:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

对比grok-beta的效果,可以看到claude-3.5-sonnet-20241022生成的游戏更加完整,玩家、AI、可以增加分数的物品三个元素都有:

资讯丨xAI官宣Grok API开启公测,唯一模型grok-beta表现能否达到预期?

总结

通过实测发现,grok-beta在推理能力方面能力不如Claude 3.5-sonnet-20241022和其他同类产品般理想,而在文本理解能力和代码生成能力上,尽管grok-beta展现出了不错的理解层次,但在应对复杂场景时仍有一定的局限性。不过,grok-beta只是初始版本,目前发现出不足并不是坏事,这能够及时发现问题并通过后续的改进提升相关性能。

目前grok-beta模型为纯文本版本,而xAI透露预计在下周将发布一个可以摄取图像的多模态版本,或许我们期待下一版本的grok-beta看看。当然,302.AI也会持续给用户更新相关资讯,为大家带来更多模型性能和功能的实测!

Like (0)
302.AI302.AI
Previous 2024 年 11 月 6 日 下午7:06
Next 2024 年 11 月 9 日 上午10:30

相关推荐

  • 资讯丨字节豆包推出新图片理解功能,实测底层模型Doubao-vision-pro-32k竟大翻车?

    12月3日,字节跳动豆包上线了一项新功能——图片理解。官方表示,这一功能可精准识别图片内容,并对相关问题进行解答,无论是查找景点位置,还是辨认动漫人物身份,都能轻松应对。 据了解,图片理解功能的底层技术来源于豆包视觉模型——Doubao-vision-pro-32k,Doubao-vision-pro-32k 是字节跳动豆包大模型视觉团队研发的多模态基础模型…

    2024 年 12 月 5 日
    32700
  • Ideogram推出2.0版本,连Midjourney都感受到了压力?看看到底有多厉害?!

    8月21日,由Ideogram团队倾力打造的创新型文本生成图像模型 Ideogram 2.0正式发布。 其实早在今年2月,Ideogram团队就发布了Ideogram模型1.0版本,但是其在AI生图领域并未引起太大波澜,但在这一次 Ideogram 2.0版本发布后,Ideogram官方直接在社交媒体平台自信宣称,这一版本比FLUX Pro和DALL·E3要…

    2024 年 8 月 26 日
    41300
  • Glif生成的meme图瞎说什么大实话!如何免注册无次数限制使用?

    近日,在国外社交媒体平台上,一款叫做“Glif”的AI应用迅速蹿红,Glif有点类似国内的Coze,通过低代码或无代码的方式,并提供了非常多的工具作为节点,搭建工作流。 接下来先说一下Glif是什么,Glif是一个有趣的低代码平台,在基本层面上,Glif接受用户输入(文本、图像或点击按钮),并使用强大的AI模型生成输出(文本、图像、视频或这些的组合)。 概括…

    2024 年 7 月 17 日
    45700
  • 资讯丨实测对比Luma Labs新图像模型,Luma Photon能否胜出?

    近日,Luma Labs宣布推出两款全新图像生成模型:Luma Photon和Photon Flash,这两个图像生成模型是建立在新的突破性架构之上的,可提供超高品质的生成质量,不仅生成速度比市场上其他模型快,而且价格成本更低,为用户带来了新的视觉生成体验。 据官方介绍,在大规模双盲评估中,Luma Photon 在质量、创造力和理解力方面优于市场上的所有模…

    2024 年 12 月 4 日
    14900
  • AI视力考验:各AI模型的视觉理解能力如何?

    近日,行业内有不少新模型涌现出大众的面前,我们会发现,有的模型会在其官方宣传中提到“多模态”一词,比如大家熟知的GPT-4o、Gemini 1.5 Pro等,在发布时都被定义为“原生多模态”,这些多模态LLM在相关的介绍中,都用到了“视觉能力”、“视觉理解”这样的表述。 简单的理解,就是这些模型能够“看得见,并看得懂”,仿佛人的眼睛。为此,很多人…

    2024 年 7 月 25 日
    30900

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注