Gemini
Gemini是Google DeepMind开发的多模态大语言模型系列,继承LaMDA和PaLM 2的技术路线,于2023年12月6日正式发布[^c1]。该系列以原生多模态能力为核心特征——从设计之初就联合预训练文本、图像、音频、视频和代码。2025年9月美国DOJ反垄断庭审披露,Gemini的预训练数据主要来自Google内部维护的Google Common Corpus(GCC)[^c23]。
Gemini系列包含多个规模层级:Ultra(旗舰版本,面向高度复杂任务)、Pro(通用版本)、Flash(轻量高效变体)和Nano(端侧设备版本)。Gemini 1.0 Ultra在发布时成为首个在MMLU基准上超过90%的模型[^c2],在32项学术基准中的30项上达到当时最优水平[^c4]。Gemini 1.5引入了稀疏混合专家架构,支持最高1000万token的上下文窗口[^c3]。2025年,Gemini 2.5系列正式引入"思考模型"概念[^c7]。同年11月发布的Gemini 3 Pro将上下文窗口扩展至100万token[^c8],并推出Deep Think并行推理模式[^c9]。
2026年5月的Google I/O大会将战略重心全面转向AI智能体基础设施。Google历史上首次将搜索描述为"25年来最大规模更新"[^c18],AI生成答案取代传统链接列表成为主要回应方式。Gemini 3.5 Flash以"为行动而生,而非仅为回答"的定位成为Google默认AI模型[^c5],在编码和智能体基准测试中超越Gemini 3.1 Pro[^c11]。同月发布的Gemini Omni作为多模态生成模型,支持任意输入到任意输出的转换。此次I/O推出全天候个人AI代理Gemini Spark[^c24]、CodeMender安全智能体、Antigravity 2.0等一系列产品,标志着AI竞争从模型能力进阶到Agent经济学阶段[^c13]。两项支撑科学研究——Co-Scientist和ERA——同日发表于Nature,在药物发现和流行病学预测中展示了AI加速科研的能力[^c37]。
2026年6月,Gemini生态进入密集的产品交付与挑战并存的阶段。Gemini Spark正式面向美国AI Ultra订阅用户开放,被评测为"最令人惊叹的AI体验之一"[^c25]。同月,Gemini 3.5 Pro未能按计划于6月全面可用,Google将公开发布推迟至7月,但该窗口亦未能兑现——Bloomberg于7月16日报道模型编码性能仍未达标,Alphabet股价当日下跌4.4%[^c46]。这是Google在2026年第二次重大AI交付延期(此前Gemini Ultra 1.5曾被推迟三个月)[^c31]。更引人关注的是,同一周内多位资深Gemini研究员宣布离职加入Anthropic和OpenAI,包括Gemini联合负责人Noam Shazeer、诺贝尔奖得主John Jumper以及核心研究员Jonas Adler、Alexander Pritzel和Arthur Conmy[^c34],引发了业界对Google AI人才保留能力的广泛关注。Google随后在组织上进行了调整,在预训练与后训练之间新设中间训练团队(mid-training team),专门负责提升编码等特定领域能力[^c38]。6月10日,Google发布Gemini 3.5 Live Translate实时语音翻译模型,支持70余种语言[^c33]。同一天,Google宣布将Gemini in Chrome浏览器AI助手扩展至拉丁美洲、非洲、中东等更多地区的桌面端与iOS用户[^c55]。
2026年7月1日,Google推出Nano Banana 2 Lite,作为更快速、更低成本的图像生成变体,进一步扩展了Gemini图像生成产品线的覆盖范围[^c39]。7月8日,Google Photos推出Video Remix功能,由Gemini Omni驱动,支持基于文本指令的视频编辑与头像嵌入。7月10日,AI Mode正式成为Google搜索在200个国家和98种语言中的默认搜索体验[^c41],标志着Gemini驱动的搜索全面转向AI优先架构。同期,Cognizant宣布将Gemini Enterprise部署至10万至20万名员工,并认证1万名专业人员[^c40],标志着Gemini在企业级大规模落地方面取得重要进展。Gemini应用负责人Josh Woodward公开征集用户反馈,收到超过1,700条投诉,以罕见的透明度承诺修复Workspace集成等问题[^c42]。Gemini 3.1 Pro在Google Cloud上正式大规模可用,JetBrains报告显示相较Gemini 3 Pro Preview提升达15%[^c45]。人才流失事件与Gemini Spark的同期推出形成了鲜明对照——分析人士将Spark定位为Google在人才压力和市场竞争下加速AI产品化的标志,标志着AI从"副驾驶"向"司机"角色的转变[^c44]。7月16日,欧盟委员会依据《数字市场法案》发布两项约束性裁决,要求谷歌向竞争对手开放Android系统AI功能并共享搜索数据[^c47],直接冲击了Gemini在Android生态和搜索领域的竞争优势。
2026年7月21日,Google发布了三款全新轻量模型:Gemini 3.6 Flash(输出token消耗降低17%,编码能力显著提升[^c49])、Gemini 3.5 Flash-Lite(超低成本高吞吐模型)和Gemini 3.5 Flash Cyber(网络安全专用漏洞挖掘模型)。Google同时确认已开始Gemini 4的预训练,这是其"迄今为止最雄心勃勃的预训练计划"[^c54]。7月22日公布的Alphabet 2026年第二季度财报显现出复杂图景——Gemini月活跃用户达到9.5亿,较2025年10月增长46%[^c50],Google Cloud收入同比增长82%,但同时录得自2004年上市以来首次负自由现金流(流出59亿美元)[^c51]。同日,第三方评测数据显示谷歌主力Gemini系列综合实力已跌至全球榜单十名以外[^c52],独立评测机构Artificial Analysis也在智能指数v4.0中以GDPval-AA等新基准取代已饱和的测试,转而衡量模型完成经济性知识工作的能力[^c57]。7月23日,Google将Gemini Spark扩展至AI Pro订阅用户(每月19.99美元)[^c53],使其从高端订阅层下沉至更广泛用户群体。8月,Gemini Spark进一步登陆macOS版Gemini应用,在侧边栏新增专属分页,可直接操作本地文件并接入多项第三方服务[^c56]。
在基础设施层面,Gemini API需求急剧增长导致算力供应紧张。2026年3月前后,Google告知Meta无法足额供应其所需的Gemini模型算力额度,打乱了Meta多项内部AI项目[^c36]。为缓解算力压力,Google与SpaceX签署了GPU租赁协议,租用约11万块Nvidia GPU,月租金约9.2亿美元,协议总价值约300亿美元[^c48]。5月17日起,Google对所有Gemini应用实施基于算力额度的使用限制。这一问题凸显了AI基础设施建设仍难以跟上生成式AI快速扩张的需求。
在治理层面,Google于5月22日向DC Circuit法院提交了反垄断上诉状,请求推翻2024年的搜索垄断裁定和已生效的数据共享补救措施[^c32]。2026年7月,欧盟委员会依据《数字市场法案》发布约束性裁决,要求谷歌开放Android系统AI功能并共享搜索数据,使谷歌在全球范围内同时面临美国和欧盟的双重监管压力[^c47]。6月12日,Google首次就Gemini被滥用提起诉讼,指控中国网络犯罪团伙利用该模型构建钓鱼网站。此外,Google为Gemini推出"Help is available"心理健康危机干预功能[^c28],SynthID数字水印技术已标记超过1000亿张图像和视频[^c29]。
Gemini的快速迭代得益于Google在软硬件垂直整合方面的系统性优势——自研TPU加速器、OCS光交换网络、JAX/XLA软件栈和RLAIF自动化训练流程共同构成了其技术护城河,使完整训练周期可压缩至约三个月[^c12]。Google服务的月度token处理量已达3.2千万亿[^c19],资本支出从2025年的914亿美元大幅增长,2026年资本开支指引上限在第二季度财报中进一步上调至2050亿美元[^c20]。Alphabet 2026年第一季度财报显示Google Cloud营收同比增长63%,企业生成式AI产品营收同比增长近800%[^c22]。
在硬件层面,Google于The Android Show 2026上推出Gemini Intelligence高端AI品牌和Googlebooks新硬件品类,将Android定位为Gemini落地的硬件骨架[^c21]。该系列已深度集成到搜索、广告等全线产品中,并通过与Apple的合作伙伴关系覆盖超过22亿台活跃设备[^c10]。