全球 AI 模型发布时间轴
左侧国外 · 右侧国内 · 仅展示发布时间,不比较模型能力
共 264 条记录
2026
9 月
咕咕嘎嘎
8 月
千问新一代高性价比模型
实验性多模态视觉理解模型,Agent 能力接近 Opus-4.8。
编程较 5.2 提升 50%,网络/命令行/终端能力突出(开源)。
Agent 能力大幅提升,原生支持 Responses API。
模型卡更新,最新 Flash 版本。
面向长运行 agent、coding、知识工作。第三方口径
全新多模态智能体模型预览:轻量敏捷、自主规划、多 Agent 协作、动态纠偏。
从 Muse Spark 蒸馏,Apache 2.0,单 GPU 本地运行;Muse 系列首个公开权重模型。
与 Muse Code 编码智能体同步推出,面向终端编码/软件工程;闭源。扎克伯格 8-10 承诺未来几周开放权重,截至 8-26 未发布。
联合理解声音、画面与时序,实现边看边听边说的交互。
Qwen3.8-2.4T-A95B是阿里巴巴旗下的大模型
7 月
deepseek-v4-flash正式版发布,能力超过deepseek-v4-pro预览版
文生图/图像编辑,Quality Mode 上线。第三方口径
一镜成片、多模态参考、编辑能力升级,已上线豆包、即梦、扣子、小云雀。
新一代视频生成模型。
最强 Opus,长运行 agent、编码、专业工作,多端可用。
面向高规模 AI agent 构建。
Flash 系列新一代,效率、延迟与可靠性。
通用旗舰,支持文本与视觉输入、百万 token 上下文。
三档:Sol 旗舰推理、Terra 均衡、Luna 高效低成本;2026-08 更新引入更强版本并加入 effort slider。
旗舰级更新,面向 coding/science/math。第三方口径
agentic 提升,computer use、编程、多模态理解增强,上下文扩至 1M,仍闭源;Meta Model API 公开预览。
强调「不止生成,更懂设计」。
Meta 首个原生生图模型,用于 Meta AI / Instagram,照片修复、风格转换、编辑,闭源。
Meta 自有文生视频(文本到视频),含同步音频,closed beta,闭源。
全新大模型正式版,MoE 295B/21B,开源。
6 月
最强 agentic Sonnet,Free/Pro 默认模型。
Agent 与 Coding 能力全面提升。
1M 无损上下文,长程任务与编程开源 SOTA。
1.1 万亿参数编程模型,256K 上下文,开源。
更高层级通用模型;曾因出口管制暂停、7-01 重新部署。
前沿 Coding 能力,1M 上下文,原生多模态,MSA 注意力架构。
5 月
图/文 prompt 动画化,带原生同步音频,支持视频续接与参考图引导。
Apache 2.0 开源,原生多模态,最高生成速度 400 tokens/s,面向生产级 Agent。
代码、agent、专业工作协作,1M 上下文。
Nano Banana 2 / Nano Banana Pro 生图正式版。
高速版,输出约 400 tokens/s,200K 上下文。
旗舰迭代,能力进一步提升。
结合前沿智能与行动,面向 agentic 与编程。
轻量化多模态智能体模型,Token 消耗下降,SenseNova-Skills 同步开源。
ERNIE 5.0 的更小更经济版本,分 fast 与 thinking 模式。
4 月
面向编码与 agent 的模型,1M 上下文。
AI 创意画布,可生成/编辑图像、图转视频、拼接更长视频。
30B 推理/Agent 模型,256K 上下文,MoE,基于华为昇腾 910B 集群训练。
单一架构统一多模态理解、推理与图片生成(U1 系列基于 NEO-unify)。
V4-Pro约 1.6T 参数、1M 上下文,Agent 能力突出;V4-Flash 为 284B 高效版。
面向编程、知识工作与计算机使用;API 4-24 可用。
全新大模型预览,MoE 295B/21B、256K 上下文。
- MiMo-V2.5-Pro小米 MiMoLLM(纯文本)正式2026-04-23
1T/42B、1M 上下文,高负载 Agent 场景能力突出。
- MiMo-V2.5小米 MiMo多模态正式2026-04-23
原生全模态感知,图像/视频/音频/文本跨模态推理与 Agent。
进入生产阶段,面向长时编码与全栈生成。
高级软件工程与最困难代码任务大幅提升。
开源 8B 单流 Diffusion Transformer 文生图模型。
长时编码内测,增强代码与 Agent 能力。
代码增强,支持单次任务独立工作 8 小时。
Meta 首个旗舰多模态推理模型(MSL 出品),文本/图像/视频/音频,262K 上下文,闭源(仅精选伙伴 API 预览)。
视觉编程多模态 Coding 基座,200K 上下文。
针对高频 Agent 场景优化,Token 效率提升。
3 月
更具成本效益的视频生成。
ChatGPT 中推出,Free/Go 用户可经 Thinking 使用,作为 5.4 限速时的备用模型。
自主迭代能力,SWE-bench Verified 78%。
- MiMo-V2小米 MiMoLLM(纯文本)正式2026-03-18
1T/42B、1M 超长上下文,混合注意力架构。
- MiMo-V2-Omni小米 MiMo多模态正式2026-03-18
全模态,支持文本、视觉、语音理解,最高 256K。
面向智能体优化的实干型基座模型。
4-agent 并行架构、多智能体、2M 上下文窗口。
支持 computer use、视觉、工具搜索与 Agentic 调用。
高容量应用低成本模型。
2 月
更易用的日常对话模型;2026-03-03 更新搜索与回答质量,减少不必要打断。
面向开发者,API/AI Studio/Gemini CLI 等。
最强 Sonnet,计算机使用、长上下文推理。
千问 3.5 系列开源发布。
豆包大模型 2.0 系列,侧重基础模型、多模态理解与企业级 Agent。
与豆包 2.0 / Seedance 2.0 同步发布的图像生成 Preview。
视频生成新系列,与豆包 2.0、Seedream 5.0 Preview 同步发布。
Coding 与 Agent 能力开源 SOTA。
X1.5 升级版,基于全国产算力训练,293B 参数、128K 上下文。
原生 Codex 智能体,结合前沿编程性能与通用推理,支持长周期技术工作。
旗舰升级,code review、长运行 agent 改善。
- MiMo-V2-Flash-0204小米 MiMoLLM(纯文本)重大更新2026-02-04
Thinking 模式 SWE-Bench 78.6,工具调用成功率提升。
Agent 优化语言模型,约 196B 参数/11B 激活、262K 上下文,AIME 2025 达 99.8%。
视频时长提至 10 秒、720p、音频更好。
编程、工具调用、办公等生产力场景全球顶尖,编程效率较 M2.1 提升 37%。
1 月
多模态自主推理模型开源,8B/32B,动态视觉推理。
开放公共 API,提供 image-quality 与 video 模型。
支持文本、代码、视觉理解与生成,开源。
正式版图生图模型,支持精准修图。
30B-A3B MoE,开源且 API 免费。
联合华为开源首个全流程国产化多模态大模型。性质待核实
- MiMo-V2-Flash-0112小米 MiMoLLM(纯文本)重大更新2026-01-12
通用能力、Thinking 代码与工具链稳定性优化。
2025
12 月
增强 Agent 能力、多模态理解与上下文管理。
引入 Video Coding,全球开源领先。
gpt-image-1 继任者,自回归架构,编辑更精确、更好保留 logo 与人脸、改善指令遵循与小文本渲染。
面向专业影视制作与图像创作升级。
- MiMo-V2-Flash小米 MiMoLLM(纯文本)正式2025-12-16
MoE 309B/15B,SWE-Bench Verified 73.4%,高速推理。
音画高精度同步、影视级运动与情绪表现、首尾帧。
面向专业工作与长运行 Agent 的三级架构。
多模态评测多面取得 SOTA。
V3.2 与特化版正式发布。
11 月
相比 4.0 提升编辑一致性、人像美化与小字生成。
数学推理模型更新。
面向编码、agent、computer use、深度研究;1M 上下文。
8.3B 轻量化,生成 5–10 秒高清视频。
新一代旗舰,用于 Gemini App、AI Studio、Vertex。
改进人格与可用性,部分来源称成为 Auto 模式默认。
原生全模态旗舰大模型,约 2.4 万亿参数,支持文本/图像/音频/视频理解与生成;2026-01-22 上线。
更智能对话体验,Instant 引入自适应推理。
增强指令遵循、长文理解、文学创作与知识准确性。
增强指令遵循、代码、Agent、推理能力。
MoE 架构,攻克国产算力训练难题。
K2 系列深度思考版本。
10 月
Veo 3 迭代,2026-04 更新模型卡。
更快低成本小模型,agent 与 computer use 接近 Sonnet 4。
更小更便宜的图像生成变体,API 价格约低 80%,面向高并发与成本敏感场景。
文生图/图生视频/视频生成,生成延迟降至 15s,基于 Aurora 引擎。
原生支持多种思考长度并升级工具能力。
提升人物动作、画面质量与风格化,另推 Fast 版。
9 月
旗舰视频+音频生成,增强世界模拟能力,配套独立 iOS App;产品已于 2026-04-26 下架。
代码能力进阶,上下文扩展至 200K。
实验版,引入新注意力机制 DSA 提升推理效率。
Sonnet 4.5,混合推理,coding/agent/computer use 增强。
80B 参数工业级原生多模态生图开源模型。
首个专用生图模型,接入 Adobe Firefly / Express。
统一架构支持文生图与通用编辑,集成常识与推理。
开源原生 2K 生图模型。
提升真实编程与 Agentic Coding 能力。
通义万相 2.5 预览版。
8 月
混合推理架构,同时支持思考与非思考模式,迈入 Agent 时代。
约 100B 视觉推理模型,视频理解、GUI Agent。
GPT 系列换代,内置思考/推理。
Opus 4 增强版。
文生图/图生视频工具,7-28 预览,8-04 面向 SuperGrok 与 Premium+ 公开发布。
7 月
推理能力显著升级,多模态性能提升。
355B MoE,原生融合推理、编码与 Agent,开源。参数待核实
新一代基础大模型,面向全球企业开源。
快速、低成本、高性能模型。
MoE(235B/22B),非思考模式主观创作与安全性提升。
文生视频、图生视频,新增首尾帧生成。
1T/32B MoE,侧重代码、Agent,同步开源。
新一代推理模型,工具调用、实时信息与复杂推理。
视频理解、图像问答、图表解读、GUI Agent。
强化推理模型满血版。日期待核实
新一代视频生成模型系列开源。
6 月
开源,最大 ERNIE-4.5-VL 总参 424B / 激活 47B。
MoE 80B/13B,首个快慢思考可切换混合推理模型。
1080P 高清、最长 10 秒视频生成。
2.5 系列低延迟低成本正式版;Pro 亦转正式。
开源大规模混合架构推理模型,约 456B,1M 上下文、80K 推理输出。
推理、多模态、GUI 操作、前端编程与 256K 上下文升级。
多镜头叙事、首尾帧、主体一致性、1080P 输出。
5 月
Claude 4 系列,代码、代理、长时运行与复杂推理。
视频生成,面向 Gemini App / Flow / Vertex 等。
4 月
- MiMo-7B小米 MiMoLLM(纯文本)正式2025-04-30
7B 推理模型(低于 27B,属重大突破例外收录),数学与代码表现突出。
支持推理/非推理双模式,覆盖多规模密集与 MoE 并开源。
聚焦多模态、强推理、低成本(百度 Create 大会)。
更强推理模型,支持工具调用与图像推理。
原生 2K 输出、更快响应、更准小字与排版。
API 发布,强调编码、指令遵循、长上下文与视觉;5-14 入 ChatGPT。
600B 多模态 MoE,支持中长视频直接推理。
开源,原生多模态 MoE,Scout 10M 上下文、Maverick 1M。
约 2T/288B 教师模型,截至 2026-08 未公开权重。
视觉语言模型,16B MoE / 3B 激活。
3 月
端到端多模态流式响应(视觉、听觉、写作、工具)。
ChatGPT 原生图像生成(3-25),API 端以 gpt-image-1 于 2025-04-23 开放,支持文生图、图像编辑、文字渲染。
推理模型,可控思考预算,代码、数学增强。
推理增强,MMLU-Pro 等多项指标显著提升。
腾讯首个深度推理模型,数学、逻辑、科学、代码。
4.5 原生多模态 + 文本/逻辑推理;X1 面向深度思考。
首个开源汉字生成文生图模型。
2 月
研究预览,更强聊天、创意与通用推理。
通义万相 2.1 系列视频生成并开源。
混合推理,标准+扩展思考双模式,同步发布 Claude Code。
高能力实验模型,长上下文与复杂任务。
推理模型,多智能体推理、Think/Big Brain 模式、DeepSearch 研究 agent;面向 X Premium+。
视觉-语言多模态,强化视觉理解与交互。
1 月
科学、数学、编码小推理模型,可调推理深度。
大规模 MoE 旗舰模型。
Doubao-1.5-Pro / Vision-Pro 更新(256K 上下文)。
强化推理模型,推理能力突出。
多模态思考模型,128K 上下文,强化数学、编程、推理。
低延迟视频理解与语音交互、Function Call。
全国产算力深度推理模型,图文、数学、长文本。
基于单张参考图的主体一致生成。
2024
12 月
671B/37B MoE,FP8 训练,上线 API。
视频生成,支持 4K 与物理理解。
原生多模态、工具调用、低延迟。
Flash 系列推理增强版。
Sora 从研究预览转为产品,速度显著提升,面向 ChatGPT Plus/Pro。
开源,性能接近 Llama 3.1 405B。
推理模型正式版及更强 Pro 版。
130 亿参数视频生成模型开源。
上线豆包 APP 与即梦平台,受设计师欢迎的生图模型。
11 月
新一代视觉语言旗舰模型。
上下文扩展至 100 万 tokens。
10 月
核心能力全面超越 GPT-4 Turbo,代码/数学超越 GPT-4o,74 种语言。
新增计算机操作(Computer Use)、Artifacts 等能力。
低成本高速度模型。
9 月
开源,引入视觉模型与轻量边缘模型。
豆包视频生成,面向企业邀测(含 Seaweed)。
Qwen2.5-72B 性能超越 Llama 3.1-405B。
影视级高清视频生成。
首代强化推理模型。
合并 Coder-V2 与 V2-Chat 升级。
8 月
首个文生视频模型,上线海螺 AI。
高质量图像与视频理解能力。
全模态免费版。
生图能力接近 Midjourney V6 / FLUX。
Grok 2 系列,支持图像理解,向 X 与 API 开放。
7 月
对标 Sora 的开源视频生成模型,最高 2 分钟 1080P。
开源,405B 旗舰、128K 上下文、8 语言。
更小、更经济的多模态模型。
对标 GPT-4o,实时流式多模态、音视频对话。
万亿参数 MoE,中国公司首创。
6 月
更高性价比版本。
七大核心能力升级,对标 GPT-4 Turbo / GPT-4V。
代码、推理、视觉能力显著增强。
代码 MoE,支持 338 种编程语言。
开源大模型新一轮升级。
5 月
Grok-1.5 提升推理与上下文;1.5V 增加图像理解。
火山引擎发布,正式对外服务。
Pro / Flash 面向更广泛用户与 API 开放。
中英双语理解与文生图扩散模型。
原生文本、视觉、音频统一多模态,实时交互。
236B/21B MoE,MLA 架构,128K 上下文。
4 月
600B MoE、200K 上下文,综合性能对标 GPT-4 Turbo。
开源,增强推理能力。
万亿参数 MoE 系列,200K 上下文。
3 系列轻量低延迟版本。
3 月
多模态视觉理解、200K 上下文;Opus 偏能力、Sonnet 偏速度成本。
约 100B 多模态,图像理解与图文对话。精确日期待核实
2 月
文生视频研究预览。
长上下文能力,后逐步开放。
日日新系列迭代。
开源系列迭代(含 72B 旗舰)。
2023
12 月
原生多模态(文本、代码、图像、音频、视频输入)。
11 月
新增标准版服务。
128K 上下文 gpt-4-1106-preview,gpt-4-vision-preview 开放视觉。
首批面向 X Premium+ 用户开放。
10 月
千亿级参数升级。
文生图;ChatGPT Plus/Enterprise 上线,11 月开放 API。
理解、生成、逻辑、记忆能力提升,启动邀测。
支持约 20 万字长文本。
早期 API 模型系列。
9 月
中文创作、复杂逻辑推理与任务执行,经腾讯云开放。
8 月
早期基础对话模型。
7 月
开放权重,商业许可,4K 上下文。
更新迭代版对话模型。
面向图像创作的生图大模型,定向邀测。
5 月
支持 16K 上下文。
4 月
大语言模型系列首次发布。
国内较早全栈大模型体系,180B 参数。
2022
11 月
对话式通用大模型,首个面向公众的研究预览版本。