谷歌发布全新Gemini 3.8模型,强力进军AI领域
在2026年9月3日,谷歌推出了Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型。前者专注于编程、AI智能代理和复杂推理,而后者则侧重于漏洞检测和自动修复。此次发布距离Gemini 3.7 Flash只有三周时间。谷歌称Gemini 3.8 Flash是迄今为止推理和编程能力最强的Gemini Flash模型。与前一版本相比,新模型在长周期软件工程、AI代理任务以及金融和法律等多个专业领域的多步推理能力上都有明显提升,同时保留了Flash系列的高效性和性价比。
Gemini 3.8 Flash在处理复杂任务时会投入更多的计算资源。当遇到具有挑战性的任务时,该模型会进行更多推理步骤并多次调用工具以实现目标。在较高的计算努力设定下,模型可能会消耗更多的Token以获取更佳的结果。如果用户更关注计算成本,则可以选择降低计算努力,或者继续使用Gemini 3.7 Flash。谷歌表示,3.7 Flash将继续获得全面支持。
在测试中,Gemini 3.8 Flash在编程和AI代理方面展现了显著提高。在长周期软件工程测试DeepSWE v1.1中,Gemini 3.8 Flash成功解决复杂工程问题的表现超越了许多大型前沿模型。谷歌最初公布的成绩为71.0%,但后被修正为73.7%。负责Google AI Studio和Gemini API的Logan Kilpatrick在社交媒体上表示,之前的数据上传存在错误。
此外,针对金融和法律领域的Vals Finance Agent V2和Harvey的法律代理基准测试中,新模型也取得了超越Gemini 3.7 Flash和其他部分前沿模型的优异成绩。在评估STEM人文学科和专业领域的多步推理能力的HLE-Verified测试中,Gemini 3.8 Flash得分达到54.9%。定价方面,Gemini 3.8 Flash的发布价格与3.7 Flash相同,均为每百万输入Token 0.75美元,每百万输出Token 3.75美元,但这一价格有效期至2026年12月31日。自2027年1月1日起,输入和输出价格将翻倍。
同时发布的Gemini 3.8 Flash Cyber专注于代码安全。谷歌强调,Cyber版本在自我漏洞发现和自动修复能力上有显著增强。在CyberGym的漏洞发现测试中,3.8 Flash Cyber的表现超过了此前的Gemini 3.5 Flash Cyber,以及其他多种大型前沿模型。谷歌还设计了一套更接近真实开发环境的测试,让模型在覆盖20种编程语言的复杂代码库中寻找不同类型的漏洞,成功率超过70%。
除了漏洞发现,谷歌还对该模型进行了漏洞修复方面的训练。在CWE-Bench的漏洞修复测试中,Gemini 3.8 Flash Cyber的通过率达到了47.2%,仅比前沿模型的47.8%略低0.6个百分点。谷歌表示,3.8 Flash Cyber的运行成本明显低于其他版本。该模型从研发之初就以提升漏洞修复能力为优先目标,而非攻击能力。在Gray Swan IPI安全测试中,Gemini 3.8 Flash Cyber的攻击成功率为6.0%,而普通的Gemini 3.8 Flash为5.5%,均处于相对较低的水平,表明其不易受到诱导执行攻击行为。
谷歌已经开始将这款模型应用于自身的软件安全工作。如Chrome安全团队的测试显示,Gemini 3.8 Flash Cyber生成的正确漏洞补丁数量是其他大型商业模型的2.6倍。谷歌云漏洞研究团队还利用该模型在不到两小时内发现了一个关键基础性漏洞。谷歌指出,传统研究方式发现此类漏洞通常需要更长时间。
梅西宣布退役引发舆论热潮,范志毅早有预见
开展篮球技术研究,推动篮球运动的技术革新,提升运动员的比赛表现。...
[无下一篇]
开展篮球技术研究,推动篮球运动的技术革新,提升运动员的比赛表现。...