LLM

302.AI 基准实验室 | 谷歌时隔一周发布的新模型gemini-exp-1121，实测竟发现模型能力出现了倒退？

时隔gemini-exp-1114发布仅一周，谷歌DeepMind在11月21日再次发布实验AI模型gemini-exp-1121。根据官方介绍，gemini-exp-1121在编码、推理和视觉能力都有提升。在gemini-exp-1121发布之后，它迅速赢得了Arena榜单的冠军宝座，根据测评结果显示，除了风格控制外，其他方面都位于第一。但在发布gem…
2024 年 12 月 3 日 • 基准实验室
1.0K80
302.AI 基准实验室 | Qwen团队推出的实验模型QwQ-32B-Preview能媲美o1？来实测看看表现

11月28日，由Qwen团队推出了实验性研究模型QwQ-32B-Preview，这一模型专注于增强AI推理能力，同时在数学和编程方面表现也十分出色。阿里云通义千问团队研究发现，当模型有足够的时间思考、质疑和反思时，其对数学和编程的理解就会深化，基于此QwQ取得了解决复杂问题的突破性进展，包括： 1、在考察科学问题解决能力的GPQA评测集上，QwQ获得65.…
2024 年 12 月 2 日 • 基准实验室
1.5K80
302.AI 基准实验室 | xAI API列表新增视觉模型Grok-vision-beta，实测对比后竟有意外发现？！

11月初，xAI官宣Grok API开启公测后，我们便对当时列表中唯一的模型grok-beta进行了实测，尽管grok-beta在实测中发现了了一些不足，但其整体表现还是不错的。最近，xAI的API迎来了更新，其API列表中新增了一个名为grok-vision-beta的模型。根据xAI官方介绍，grok-vision-beta模型是其最新的图像理解模型，…
2024 年 11 月 29 日 • 基准实验室
1.7K00
302.AI 基准实验室 | OpenAI发布GPT-4o更新版本，竟能轻松拿捏《再见爱人4》经典语录？

上周，OpenAI公司发布了GPT-4o的更新版本GPT-4o-2024-11-20。这一更新全面提升了模型的创意写作水平、让写作更加自然、引人入胜且量身定制，以提高相关性和可读性。此外，它还可以更好地处理上传的文件，提供更深入的见解和更全面的响应。 GPT-4o-2024-11-20具有128K个tokens 的上下文窗口，输入价格为每百万tokens 2…
2024 年 11 月 25 日 • 基准实验室
1.7K121
302.AI 新品发布 | 聊天机器人自定义插件指南：如何5分钟实现YouTube搜索功能

近期，302.AI的聊天机器人升级了插件功能，新增了自定义插件的支持。本文将指导用户如何利用这一新功能，为聊天机器人增加搜索YouTube视频的能力。 AI的插件是什么？插件的设计理念是扩展AI的功能，使其更高效地理解并处理复杂问题。在响应用户请求时，AI能够通过集成一系列的预定义工具，动态选择最合适的工具来执行任务。这相当于为AI机器人接入了更多无形的“…
2024 年 11 月 22 日 • 新品发布
1.3K11
302.AI 基准实验室 | Mistral AI推出多模态模型Pixtral Large，实测结果让人眼前一亮？

11月19日，Mistral AI宣布推出新视觉模型——Pixtral Large。 Pixtral Large是基于Mistral Large 2构建，具有124B开放权重的多模态模型，支持128K上下文窗口，能够理解文档、图表和自然图像的同时保持了 Mistral Large 2 领先的纯文本理解能力。根据Mistral AI提供的Pixtral La…
2024 年 11 月 21 日 • 基准实验室
1.2K160
302.AI 基准实验室 | 阿里发布长上下文模型Qwen2.5-Turbo，实测结果不达预期？

继9月Qwen2.5发布后，11月18日，阿里巴巴通义千问团队再次发布新模型Qwen2.5-Turbo，大幅提升了上下文处理能力与推理速度。据了解，Qwen2.5-Turbo上下文长度从 128k 显著增加到 1M 个 tokens，约相当于 100 万个英文单词或 150 万个中文字符。这一容量可容纳 10 部长篇小说、150 小时的语音记录或 3 万行…
2024 年 11 月 20 日 • 基准实验室
2.7K10
302.AI 实战教程 | 智能机器人集成指南，全平台接入AI

聊天机器人和知识库机器人是AI领域的两大利器，分别通过AI对话和信息检索提升用户体验和工作效率。如果将这些AI工具集成到其他平台，可以显著增强交互性和信息服务准确性，提供即时信息支持，增强决策力。302.AI 提供了聊天、知识库等多种机器人及集成方式，使用户能够根据自身需求选择合适的集成方案，实现智能化升级，提升服务效率和质量。本教程旨在指导用户如何将这A…
2024 年 11 月 19 日 • 实战教程
2.3K00
302.AI 基准实验室 | DeepMind新模型Gemini-exp-1114模型霸榜第一？实测结果出人意料

11月15日，谷歌DeepMind推出Gemini-exp-1114，这是一个实验性模型。据了解，在经过6000+网友匿名投票后，Gemini-exp-1114模型在AI基准测试中位居总体排名第一，Gemini-exp-1114模型分数直涨40+，与GPT-4-latest并列第一，并超越了o1-preview。 Gemini-exp-1114在处理复杂提…
2024 年 11 月 18 日 • 基准实验室
1.1K00
302.AI 基准实验室 | “Thinking Claude”prompt真的这么神？302带你实测揭秘看看

最近，又一个prompt在网上火了起来，这一prompt名为“ Thinking Claude”，有网友称它为Claude3.5的神级prompt，而更让人意想不到的的是，这个prompt背后的作者，居然是一个十七岁的少年！ “Thinking Claude”的核心在于它引导Claude进行一种更为“人性化”的思考方式，强调思维过程的自然流动，而非简单的结构…
2024 年 11 月 15 日 • 基准实验室
2.3K160

8 / 12
5
6
7
8
9
10
11