一键重装系统工具 | U盘启动盘制作工具 | 误删文件恢复软件 | 硬盘数据抢救专家 | 电脑蓝屏修复助手 | C盘空间清理神器 | 电脑驱动离线安装工具 | 微信聊天记录恢复工具 | 照片误格式化恢复 | 电脑密码破解清除工具 | 系统崩溃紧急救援盘 | 电脑加速优化大师 | 电脑开不了机怎么重装系统 | 回收站清空了怎么恢复 | 硬盘分区丢失数据恢复 | 电脑卡顿重装系统有用吗 | U盘插入提示格式化数据恢复 | 电脑中毒文件被隐藏恢复 | 忘记电脑开机密码怎么办 | 新硬盘分区对齐工具 | 旧电脑装Win10流畅工具 | SD卡照片删除恢复免费版 | 移动硬盘打不开提示损坏修复 | 电脑无故重启系统修复工具 | 电脑小白一键重装神器 | 程序员电脑环境配置助手 | 设计师电脑字体/素材恢复工具 | 网吧网管系统维护工具箱 | 财务人员电脑发票备份恢复 | 学生党免费电脑系统安装包 | 电脑维修师傅必备工具盘 | 游戏玩家电脑性能优化助手 | 办公白领误删文档恢复软件 | 自媒体视频素材恢复工具 | 网课录制视频损坏修复工具 | 最好的U盘PE系统排名 | 数据恢复软件哪个最强 | 免费电脑助手与收费版区别 | 国产装机工具哪款无广告 | 离线版驱动助手推荐 | 轻量级电脑优化工具对比 | 支持NVMe驱动的PE工具 | 带网络功能的应急启动盘 | 2026最新版万能装机工具 | 支持Win11 24H2的PE工具 | 最新免激活系统重装工具 | 2026数据恢复软件破解版合集 | 纯净无捆绑装机助手V3.0 | 支持苹果M芯片的电脑助手 | 秋季更新版系统维护工具箱 | 电脑系统崩了怎么用U盘把重要资料拷贝出来 | 重装系统前哪些文件夹必须备份 | 固态硬盘误格式化还能恢复数据吗 | 如何制作一个既带PE又能存数据的双分区U盘 | 电脑总是弹窗广告用什么助手彻底拦截 后台管理
📢 欢迎访问系统之家!所有资源均经过安全检测。

全球AI模型发布时间线(持续更新)

发布时间:2026-09-20 | 浏览:1
📥 下载地址(文章开头)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。
https:// docs.qq.com/smartsheet/ DUXVObEpMaW5qelB2 —————— 见证AI发展时刻 —————— 欢迎评论区补充遗漏的发布事件,本文持续不定时更新中…… 2026年7月17日,月之暗面 发布开源 Kimi K3。2.8T参数,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生视觉理解,1M上下文。综合表现仅次于当时最强闭源模型Claude Fable 5和GPT-5.6 Sol。全球首个开源的2.8T级模型,面向长程编程、知识工作和推理等前沿智能场景。 2026年7月16日,SpaceXAI 宣布开源 Grok Build,开放终端用户界面、扩展系统等完整Rust源码,支持开发者自行编译并在本地运行。强调零数据保留原则。 2026年7月15日,逐际动力 发布 具身智能系统 COSA 0.5。该“人形大脑系统”由三层架构组成:System 2认知层基于语言模型,以约1Hz频率进行场景理解、记忆、推理与任务调度;System 1技能层以约50Hz频率提供可复用的技能集,视觉-语言-动作VLA模型是其调用的技能之一;System 0运控层基于自研LimX WBT全身运动基础模型,以1000Hz频率进行实时全身运动控制。将认知、记忆、调度、技能与全身运控整合,31个自由度的全尺寸人形机器人Oli可在无遥操、无剪辑的条件下,连续自主完成物体移动类家庭任务。在家庭服务、商业服务等场景中实现长程、全自主的连续操作。 2026年7月15日,Thinking Machines Lab 发布开源 大语言模型 Inkling。开放权重。架构借鉴DeepSeek-V3,训练后阶段用Kimi K2.5的数据优化。 2026年7月13日,阶跃星辰 发布 AI手机 STEPX Neo,操作系统 Step AOS,AI智能体 阶跃Amoo。STEPX Neo是依托大模型原生的AI手机。阶跃Amoo集成AI助手能力,可自然语音交互。 2026年7月10日,字节跳动 发布 AI基础设施 AI Rack 3.0。兆瓦级算力系统,800V高压直流供电与全液冷散热,单集群功率超1兆瓦。 2026年7月10日,中科曙光 发布 AI超算集群 曙光8000(登峰)。10万卡级计算能力。 2026年7月9日,浪潮信息 发布 AI基础设施 CPU原生液冷整机柜服务器,发布 AI基础设施 元脑SD200开放超节点AI服务器。前者支持Agent群智协同,后者面向多模融合场景。 2026年7月9日,xAI 发布 语言模型 Grok 4.5。基于1.5T参数V9模型,支持视觉输入,加入AI编程工具Cursor数据进行补充训练。API定价 输入Token每百万2美元,输出每百万6美元。Grok 4.5最初于2026年6月28日在SpaceX和特斯拉内部启动封闭Beta测试。 2026年7月8日, OpenAI 发布 语音模型 GPT-Live,全双工架构,在生成语音的同时持续处理输入,实现边听边说的自然对话体验。Go/Plus/Pro订阅用户默认用GPT-Live-1,Free用户默认用GPT-Live-1 mini版。遇到需要联网搜索、深度推理或复杂任务时,GPT-Live会把问题实时交给后台的GPT-5.5处理,对话不中断。未来将引入API供开发者使用。 2026年7月8日,加州大学圣迭戈分校 发布 论文(Nature) 全球首例人形机器人远程手术,用两台宇树G1机器人远程操控完成活体猪腹腔镜胆囊切除术。第一作者兼通讯人梁泽楷。展示人形机器人在远程医疗中的应用潜力。 2026年7月7日,蚂蚁灵波 发布开源 具身智能模型 全栈系列含LingBot-World 2.0、LingBot-Video、LingBot-VLA 2.0、LingBot-Vision、LingBot-Depth 2.0、LingBot-VA 2.0等共7个模型。280B MoE实时交互世界模型,支持17厂商20余种机器人构型。用于机器人自主感知、决策和操作。 2026年7月6日,腾讯 发布开源 通用语言模型 混元Hy3 (正式版)。混合专家MoE模型,总参数295B、激活参数21B,256K上下文。相比4月23日发布的Hy3 preview,在复杂推理、指令遵循、代码生成与智能体Agent能力上继续提升。Apache 2.0开源协议。 2026年7月1日,Anthropic Claude Fable 5 全球恢复上线。先前被美国政府封禁。 2026年7月1日,美团 发布开源 通用语言模型 LongCat-2.0。总参数1.6T,激活参数范围33B至56B,原生1M Token上下文。国产算力集群全流程训练与推理的万亿参数模型。 2026年6月30日,华为 发布开源 通用语言模型 openPangu-2.0-Flash。参数92B,深度适配昇腾算力,针对鸿蒙系统完成专项优化。帮助鸿蒙生态开发者快速集成AI能力。 2026年6月27日,OpenAI 发布 通用多模态模型 GPT-5.6系列Sol/Terra/Luna。Sol为旗舰版,Terra均衡版,Luna轻量版,新增max推理强度和ultra多智能体并行模式,初期仅限可信合作伙伴预览。2026年7月9日,GPT-5.6 全量上线ChatGPT、Codex及API。 2026年6月24日,OpenAI与博通 联合发布 AI推理芯片 Jalapeño。专为语言模型推理设计的专用集成电路(ASIC)。以更低成本、更高效率运行大模型推理。 2026年6月23日,字节跳动 发布 通用语言模型 Doubao-Seed-2.1 Pro。256K上下文,定价输入每百万Token 6元、输出每百万Token 30元,缓存命中1.2元。重点强化Coding编程、Agent智能体及VLM视觉语言能力。发布 视频生成模型 Seedance 2.5、图像生成模型 Seedream 5.0 Pro、音频模型 Seed-Audio 1.0。帮助创作者实现多模态内容生成。 2026年6月15日,字节跳动 发布 视频生成模型 Seedance 2.0 Mini。轻量级视频生成模型。帮助中小团队快速生成视频内容。 2026年6月13日,智谱AI 发布 通用语言模型 GLM 5.2。总参数744B,激活参数40B;1M token上下文;MIT开源协议。于6月17日上线API并正式开源;已适配华为昇腾、平头哥、摩尔线程、寒武纪等国产算力平台。 2026年6月12日,月之暗面 发布开源 代码模型 Kimi K2.7-Code,总参数1.1T,激活参数32B,MoE架构,384个专家模块,每Token选8个专家+1个共享专家,256K上下文。高速版于6月15日上线。 2026年6月11日,小米 发布开源 编程Agent MiMo Code,MIT协议。支持持久记忆架构,可在终端设备运行。用于本地化的AI编程辅助。 2026年6月10日,摩尔线程 发布开源 代码模型 MusaCoder。MusaCoder-9B和MusaCoder-27B,基于国产全功能GPU训练与验证,后训练基于MTT S5000构建的夸娥智算集群。支持从PyTorch标准算子自动生成高性能CUDA/MUSA原生Kernel代码,降低开发者手写底层GPU算子的门槛,提升GPU高性能计算场景下的代码生成、验证和优化效率。 2026年6月9日,Anthropic 发布 通用语言模型 Claude Fable 5 和 Claude Mythos 5。两者基于同一底层Mythos级模型架构。Fable 5面向公众开放,定价输入每百万Token10美元、输出每百万Token50美元,在软件、知识、视觉等领域表现突出,自动安全降级机制,在高风险领域自动切换至Claude Opus 4.8响应;Mythos 5通过Project Glasswing项目向网络安全与基础设施合作伙伴开放,在药物设计、分子生物和网络安全领域表现突出。 2026年6月9日,蚂蚁集团 发布开源 大语言模型 百灵Ling-2.6-flash。总参104B,激活7.4B,轻量版。适合低延迟场景部署。 2026年6月1日,MiniMax 发布 通用语言模型 M3。自研MSA稀疏注意力架构,最高1M上下文,原生支持图片和视频输入,具备Computer Use桌面操作能力。2026年6月12日正式开源开放权重。 2026年5月29日,阶跃星辰 发布开源 通用语言模型 Step 3.7 Flash。稀疏MoE架构,总参数196B并配备1.8B参数视觉编码器(ViT),激活参数11B,256K上下文,原生支持图像、UI界面、图表、文档等多模态理解,强化了联网与视觉搜索能力,可在长程多轮工作流中稳定调用API、浏览器、终端及Office工具。 2026年5月28日,Anthropic 发布 通用语言模型 Claude Opus 4.8。上下文1M token,最大输出128K token,知识截止日期为2026年1月;定价与Opus 4.7一致,输入每百万token5美元、输出每百万token25美元;重点提升编程、智能体任务和专业工作方面的表现;Claude Code新增 动态工作流dynamic workflows 功能,可在单个会话中并行运行数百个子智能体,处理大规模编程任务。 2026年5月28日,雷神与AMD 联合发布 AI工作站 AI Master T9000、AI Master D9000及移动AI工作站。T9000 FP8算力3064 TFLOPS,D9000支持96GB共享显存可运行671B模型。帮助科研人员和开发者获得从桌面到移动的AI算力。 2026年5月22日,字节跳动智能创作实验室 发布开源 多模态模型 Lance。激活参数3B,双流混合专家MoE架构与模态感知旋转位置编码MaPE;原生统一支持图像理解、视频理解、图像生成、视频生成和跨模态编辑;Apache 2.0开源协议,单张40GB显存消费级显卡即可运行。 2026年5月20日,Cohere 发布开源 通用语言模型 Command A+。稀疏MoE架构,总参数218B,激活参数25B;128K输入上下文与64K输出;支持文本、图像输入及工具调用;支持48种语言;Apache 2.0开源协议。 2026年5月20日,阿里通义 发布 语言模型 Qwen3.7-Max和Qwen3.7-Plus。具备多模态推理与视觉理解能力。 2026年5月20日,阿里平头哥 发布 AI芯片 真武M890,发布 互联芯片 ICN Switch 1.0。真武M890为训推一体AI芯片。帮助企业降低芯片采购成本。 2026年5月19日,谷歌 发布 通用语言模型 Gemini 3.5 Flash。支持文本、图像、音频、视频等多模态输入,1M上下文,知识截止日期为2026年1月。强化编程与智能体Agent任务处理能力。发布 视频模型 Gemini Omni。支持文本、图像、音频、视频任意组合作为输入,可对话进行视频编辑。Gemini Omni Flash同日上线Gemini应用、Google Flow和YouTube Shorts。用自然语言对话完成从视频生成到编辑的全流程创作。发布 AI智能体 Gemini Spark。由Gemini 3.5 Flash模型与Google Antigravity智能体框架驱动,可7×24小时在后台云线上持续运行;集成Gmail、Google Docs/Sheets/Slides等Workspace应用,支持MCP协议接入第三方工具;用户可用Gemini应用访问,目前面向美国Google AI Ultra订阅用户提供Beta测试。 2026年5月19日,联想 发布 AI主机 P7。搭载后摩智能M50芯片,手掌大小机身内可运行122B参数本地大模型。帮助用户在边缘设备上运行模型。 2026年5月19日,英伟达 发布 AI芯片 Vera CPU。专为AI推理与训练优化,交付Anthropic、OpenAI等四家AI实验室。提升模型训练与推理效率。 2026年5月18日,摩尔线程 发布 AI基础设施 夸娥万卡级智算集群,发布 终端芯片 长江SoC及智能终端MTT AICUBE、MTT AIBOOK、MTT E300边缘AI模组,发布 具身智能仿真平台 MT Lambda,发布 AI智能体 小麦。MTT AICUBE为家庭AI中枢,整合智能体、AI PC与AI NAS能力;MTT AIBOOK为AI算力本,运行MTT AIOS系统,预装龙虾智能体支持多智能体协作;MTT E300提供50TOPS异构AI算力,面向工业质检、能源巡检、具身智能等边缘场景。小麦智能体集成90余项CLI工具,预装60余项技能,支持超36款APP跨应用控制。MUSA软件生态同步演进,MUSA SDK 5.1.0对标CUDA 12.8,完整支持PyTorch全部3194个算子。提供从大模型训练到端侧部署的全链路国产算力方案。 2026年5月16日,上海人工智能实验室 发布开源 科学模型 书生Intern-S2-Preview。参数35B,多模态理解与推理;首次在开源通用模型中实现材料晶体结构生成;覆盖生物多组学理解、遥感感知、科学图表解析等数百项专业科学任务;基于昇腾Atlas 900 A3超节点完成训推全流程优化。在材料科学、生物医药、地球科学等领域以较低算力门槛开展AI驱动的科学发现与复杂推理任务。 2026年5月14日,xAI 发布 AI编程智能体 Grok Build(早期测试版)‍。以终端CLI为核心的AI编程Agent,采用"先规划后执行"工作流,对标 Anthropic Claude Code 和 OpenAI Codex CLI。首发仅对 SuperGrok Heavy 订阅用户开放,月费约300美元,基于 Grok 4.3 beta 模型,支持2M Token上下文,最多8个并行子Agent在同一会话中协同工作。 2026年5月11日,Thinking Machines Lab 发布 实时交互模型 TML-Interaction-Small。模型可连续接收音频、视频和文本输入,在同一过程中实时思考、回应和行动,突破传统AI的"一问一答"轮次模式,实现"边听边说边看"的全双工交互。能主动根据摄像头捕捉到的视觉线索如场景变化、物体出现做出反应,无需用户语音提示。能感知时间的流逝,可执行“等我几秒再回答”这类对时间有要求的指令。 2026年5月9日,蚂蚁集团 发布 语言模型 百灵Ring-2.6-1T。 2026年5月9日,百度 发布 通用语言模型 文心5.1。多维弹性预训练,总参数压缩至文心5.0的约1/3、激活参数压缩至约1/2。 2026年5月6日,xAI 发布 语言模型 Grok 4.3。支持1M 上下文,X平台原生实时数据融合。可用于实时信息查询和推理任务。 2026年5月5日,OpenAI 发布 通用语言模型 GPT-5.5 Instant。轻量高效版本。 2026年4月29日,蚂蚁百灵 发布 通用语言模型 Ling-2.6-flash商业版 LingDT-2.6-flash。总参数104B,激活参数7.4B,在同等测评任务下相比同参数级别模型可节省90%Token消耗。 2026年4月28日,商汤科技 发布开源 多模态模型 日日新SenseNova U1系列,稠密网络SenseNova-U1-8B-MoT,混合专家MoE网络SenseNova-U1-A3B-MoT。商汤自研NEO-unify架构,单一模型统一多模态理解、推理与生成;单次单模型调用即可完成图文混合内容生成。 2026年4月24日,蚂蚁百灵 发布 通用语言模型 Ring-2.6-1T 和 Ling-2.6-1T。其中Ling-2.6-1T采用MLA与Linear Attention混合架构,以“快思考”机制实现高效推断,256K上下文,面向更高能力密度和更强通用Agent能力。 2026年4月24日,深度求索 发布开源 语言模型 DeepSeek V4-Pro和V4-Flash。V4-Pro总参数1.6T,激活参数49B;V4-Flash总参数284B,激活参数13B。两者均采用MoE架构,支持1M超长上下文,采用全新DSA稀疏注意力机制,大幅降低计算和显存需求。首次适配华为昇腾910B国产算力。 2026年4月24日,OpenAI 发布 通用语言模型 GPT-5.5 和 GPT-5.5 Pro。GPT-5.5支持1M token上下文,输入价每百万token 5美元、输出价每百万token 30美元;GPT-5.5 Pro输入价每百万token 30美元、输出价每百万token 180美元。费用进一步降低。多模态输入理解,强化Agent原生能力,可自主规划执行路径、调用工具、校验结果并持续推进任务。 2026年4月23日,英特尔 发布 AI芯片 至强600,发布 GPU 锐炫Pro B70与B65。至强600为工作站处理器,锐炫Pro为专业级GPU。至强600为工作站处理器,最高86核心,128条PCIe 5.0通道,每核内置AMX引擎并新增FP16原生支持。锐炫Pro B70是第二代Xe2架构,32GB显存、32个Xe核心,AI算力峰值367 TOPS;锐炫Pro B65同样32GB显存,AI算力197 TOPS。 2026年4月23日,小米 发布 通用语言模型 MiMo-V2.5系列(MiMo-V2.5、MiMo-V2.5-Pro、MiMo-V2.5-TTS Series、MiMo-V2.5-ASR)。其中MiMo-V2.5-Pro是MoE架构,总参数1.02T,激活参数42B,支持1M上下文;MiMo-V2.5原生多模态理解Agent模型,支持图像、音频、视频输入;MiMo-V2.5-TTS Series支持文本描述造音色与零样本克隆;MiMo-V2.5-ASR支持中英及粤语、川语、吴语、闽南语等方言识别。该系列4月27日宣布全面开源,5月27日API实施永久降价,最高降幅99%。 2026年4月23日,腾讯 发布开源 通用语言模型 混元Hy3 preview。混合专家MoE模型,总参数295B、激活参数21B,256K上下文。每MoE层含192个路由专家和1个共享专家。 2026年4月22日,蚂蚁百灵 发布 通用语言模型 Ling-2.6-flash。总参数104B,激活参数7.4B,混合线性MoE架构;262K上下文;API定价输入每百万token 0.1美元、输出0.3美元。适合信息抽取、格式转换、批处理、长输出及Agent工作流中的轻量执行节点。 2026年4月22日,谷歌 发布 AI芯片 TPU 8t与TPU 8i。第八代训推分离TPU芯片,8t为训练专用、8i为推理专用。计划2026年末上市。 2026年4月22日,阿里通义 发布开源 通用多模态模型 Qwen3.6-27B。270亿参数稠密多模态模型,支持图像、视频与文本混合输入,具备视觉推理、文档理解和视觉问答等能力,可扩展至1M上下文。可在消费级显卡上部署。 2026年4月21日,OpenAI 发布 图像模型 GPT Image 2。最高4096×4096分辨率输出,原生1K、2K及4K质量等级,可生成宽高比从3:1至1:3的多种比例图像。首次在图像生成中集成推理能力,能在生成前规划图像结构并进行自我检查。模型文字渲染准确率提高,支持中日韩阿拉伯等多种语言;单次最多16张参考图,支持角色一致性和多图风格迁移;生成速度较前代提升1倍;提供低中高三种质量档位,低质量模式适用延迟敏感场景。可自然语言生成包含精准文字排版的海报、菜单、UI设计图等可直接交付的视觉素材,或完成系列漫画、品牌物料等需要保持角色和风格一致的系列图像创作。 2026年4月20日,月之暗面 发布开源 通用语言模型 Kimi K2.6。MoE架构,总参数1T,激活参数32B,集成MoonViT视觉编码器实现原生多模态理解融合,256K上下文。支持300个子智能体并行协作,最高4000步连续编码。 2026年4月20日,阿里 发布 通用语言模型 Qwen3.6-Max-Preview。262K token上下文。在智能体编程、世界知识和指令遵循方面比Qwen3.6-Plus均有提升。 2026年4月16日,Anthropic 发布 通用语言模型 Claude Opus 4.7。上下文1M token,知识截止日期为2026年1月。输入视觉理解分辨率提升至长边2576像素,约3.75M像素。定价输入每百万token 5美元、输出每百万token 25美元。在高级软件工程、复杂多步骤任务及专业知识工作方面能力提升,可自主验证输出结果。 2026年4月14日,OpenAI 发布 通用多模态模型 GPT-6 (Spud)。全新"Symphony"架构,原生多模态统一处理文本、图像、音频与视频,参数量达5T至6T,支持2M上下文。GPT-6分阶段开放,优先向企业客户和研究机构提供API服务,后续逐步向公众开放。 2026年4月7日,智谱AI 发布开源 通用语言模型 GLM-5.1。MoE架构,总参数744B,256个专家,每token激活8个专家;200K上下文,最大输出128K;MIT开源协议。可自主持续工作8小时,覆盖从规划、执行、测试到交付的闭环;基于10万颗华为昇腾910B芯片训练。 2026年4月2日,阿里 发布 语言模型 Qwen3.6-Plus。 2026年4月2日,Google DeepMind 发布开源 通用语言模型 Gemma 4系列(E2B、E4B、26B-A4B、31B)。其中E2B有效参数2.3B,E4B有效参数4.5B,26B-A4B为MoE架构、总参数26B、激活参数约4B,31B为密集架构、总参数30.7B。全系列支持多模态文本与图像输入,E2B、E4B及后续12B版支持音频,支持140多种语言,上下文小模型128K、大模型256K,Apache 2.0开源协议。全系内置可配置思考模式,原生支持函数调用与结构化JSON输出。可在从移动设备到工作站的各种硬件上部署。 2026年3月27日,美团 发布开源 多模态模型 LongCat-Next,并开源其核心组件 离散原生分辨率视觉分词器dNaViT。模型基于LongCat-Flash-Lite MoE架构,总参数68.5B,激活参数3B。模型采用DiNA(Discrete Native Autoregressive)离散原生自回归架构,将图像、语音与文本统一映射为同源的离散Token,下一个Token预测(NTP)范式统一建模各类模态,生成文本、图像与音频。dNaViT分词器支持原生任意分辨率,通过残差向量量化将图像压缩为离散表示。 2026年3月27日,昆仑万维 发布 游戏世界模型 Matrix-Game 3.0,视频模型 SkyReels V4,音乐模型 Mureka V9。Matrix-Game 3.0支持720P@40FPS实时生成游戏画面。SkyReels V4实现视频创作音画同步与精准控制。Mureka V9提升音乐生成的可控性与质感。 2026年3月19日,小米 发布 通用语言模型 MiMo-V2-Pro。总参数1T,激活参数42B,混合注意力架构,1M上下文,API定价256K上下文以内输入每百万tokens 1美元、输出每百万tokens 3美元。对智能体Agent场景加强优化。 2026年3月18日,MiniMax 发布 语言模型 M2.7。MoE架构,总参数229B,激活约10B,200K上下文。2026年4月12日,M2.7 开源开放权重,完成华为昇腾、摩尔线程、沐曦、昆仑芯、NVIDIA等海内外多家芯片厂商及Together AI、Fireworks、Ollama等推理平台的接入与适配,多种AI芯片上可"零代码修改"适配运行。 2026年3月17日,OpenAI 发布 通用语言模型 GPT-5.4 mini。轻量版本。上下文400K,最大输出128K,知识截止日期为2025年8月31日,支持文本与图像输入;API定价输入每百万tokens 0.75美元、输出每百万tokens 4.50美元。专为高吞吐量与低延迟工作负载设计,运行速度较GPT-5 mini提升两倍以上。 2026年3月16日,英伟达 发布 AI计算系统 Vera Rubin NVL72。机架级全液冷AI计算系统,单机架集成72颗Rubin GPU与36颗Vera CPU,第六代NVLink 6互连;20.7 TB总GPU内存与1,580 TB/s总带宽,NVFP4推理算力3600 PFLOPS,NVFP4训练算力2520 PFLOPS;单颗GPU内存带宽22.2 TB/s;100%液冷与无线缆模块化托盘设计。以更低成本、更高能效构建大规模AI工厂。发布 AI芯片 Vera CPU。88个Olympus核心,专为智能体AI和强化学习定制,2026年6月1日全面量产交付。发布 AI芯片 Groq 3 LPU (语言处理单元),500MB片上SRAM,150TB/s内存带宽及FP8精度1.2PFlops算力,由三星代工,预计2026年下半年出货,专为AI推理场景设计,可显著降低响应延迟与单位Token成本。 2026年3月5日,浪潮信息YuanLab 发布开源 多模态模型 源 Yuan3.0 Ultra。混合专家MoE架构,总参数1010B(约1T),激活参数68.8B。通过自研层自适应专家裁剪LAEP算法,将训练初始1515B参数优化至1010B,使预训练算力效率提升了49%。 2026年3月5日,OpenAI 发布 通用语言模型 GPT-5.4 Thinking 和 GPT-5.4 Pro,均支持1M token上下文。GPT-5.4 Thinking新增“思考过程预览”功能,可处理多步推理、长上下文及工具密集型工作流。GPT-5.4 Pro面向企业级需求。OpenAI首个具备原生计算机使用Computer Use能力的通用模型,可基于截图发出键盘鼠标指令,跨应用执行复杂工作流。 2026年3月2日,阿里 发布开源 通用语言模型 Qwen3.5-0.8B、2B、4B、9B。均用原生多模态理解训练与Gated DeltaNet混合注意力机制,256K上下文,Apache 2.0开源可商用。0.8B和2B适合移动设备、IoT边缘设备及低延时实时交互。4B适合轻量级Agent智能体的多模态基座模型。9B适合较高性能但显存受限的服务器端。让普通用户手中的设备获得图像、语音等多种数据形式的实时理解与交互能力。 2026年2月19日,谷歌DeepMind 发布 通用语言模型 Gemini 3.1 Pro Preview。1M上下文,原生支持文本、图像、视频、音频四模态输入,原生SVG及3D代码渲染。API定价与Gemini 3 Pro保持一致,输入2美元/百万Token、输出12美元/百万Token。 2026年2月14日,字节跳动 发布 通用语言模型 豆包Doubao-Seed-2.0。包含Pro、Lite、Mini、Code版本。 2026年2月12日,字节跳动 发布 视频模型 Seedance 2.0。统一多模态音视频联合生成架构,支持文本、图片、音频、视频四种模态混合输入,最多9张图片、3段视频、3段音频及语言指令。可生成4至15秒的480p/720p分辨率音视频内容,支持双声道音频与音素级口型同步,具备角色一致性能力与视频编辑延长功能。已接入豆包App、即梦AI网页及火山方舟体验中心。快速生成影视级画质的短视频、广告和动画内容,显著降低专业视频制作门槛。 2026年2月11日,智谱AI 开源发布 大语言模型 GLM-5。总参数744B,激活40B,MoE架构含256个专家,支持200K上下文。原生适配国产芯片平台 华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦与燧原等。 2026年2月8日,智元机器人 在上海举办 晚会《机器人奇妙夜》。由200余台人形及四足机器人主演,支持多机协同、情感交互与复杂节目执行,展示机器人在艺术表达、群体智能与人机共情等方面的应用。 2026年2月7日,波士顿动力 发布 双足人形机器人 Atlas。高1.88m量75kg,负重50kg,全身56个自由度,工作温度-20℃至40℃。多数关节可360°全向旋转,全电动续航约4h, IP67级防护,可连续空翻跳。用于工业制造及巡检与高危环境作业。 2026年02月07日,中国科学院南海海洋研究所与中国石油大学(华东) 联合发布开源 南海区域海-气双向耦合模型 飞鱼-1.0。南海区域1–3 km网格分辨率海洋与大气双向耦合模拟,数据双向反馈。提升台风路径、海温变化等预测精度,可用于海洋防灾减灾、能源勘探等。 2026年02月06日,文远知行与Uber 联合发布 自动驾驶车辆 Robotaxi,车型GXR和GXR2均是L4级自动驾驶。将在中东地区部署超1000辆,实现自动驾驶出租车规模化运营,让更多市民便捷使用无人驾驶出行服务。 2026年2月6日,Nextie 发布 AI智能体 团子。支持多Agent辩论、投票、反思,专注解决复杂决策与文档处理等实际任务。 2026年2月6日,商汤科技 发布开源 空间视觉模型 SenseNova-SI-1.3。可三维环境感知与理解。可用于机器人环境理解、AR导航、智能制造检测等场景。 2026年2月6日,动易科技 发布开源 具身智能模型 PhyCore 0.1。发布 双足人形机器人 PHYBOT C2。高1.35m重35kg,自由度25个, 双臂负载5kg,商业导览、教育科研、家庭陪伴等场景。 2026年2月5日,OpenAI 发布 通用语言模型 GPT-5.3-Codex。编程速度提升25%,参与自身开发过程中的调试与部署等任务。发布 AI平台 Frontier,可部署具备权限管理的AI Agent,用于客户服务、数据分析等场景。 2026年2月5日,Anthropic 发布 通用语言模型 Claude Opus 4.6,上下文1M Token,支持多智能体协作。发布 AI智能体 Claude Cowork及11款职能插件,Office系列等自动化处理专业流程。 2026年2月4日,钉钉 发布 AI智能体 AI小钉。 为每个工作群提供专属AI助理, 支持 自动处理办公事务、整理会议纪要、提醒待办事项等,提升团队协作效率。 2026年2月4日,面壁智能 发布开源 通用多模态模型 MiniCPM-o 4.5。参数9B,全双工多模态实时流机制,无需回合制交互。实时感知与主动回答,同时看听说。端侧小模型支持手机实时运行(骁龙8Gen3实测12FPS视频理解),适用智能家居、教育助手等交互场景。 2026年2月4日,阿里通义 发布开源 代码语言模型 Qwen3-Coder-Next。基于Qwen3-Next-80B-A3B-Base,MoE架构,256K上下文,推理成本降低,专为AI编程智能体设计。 2026年2月4日,百度 发布 AI智能体 千帆深度研究Agent。可将博士级研究任务压缩至十几分钟内完成,覆盖22个学科,适用于学术综述、金融投研、商业分析等专业领域。 2026年2月4日,昆仑万维 发布 AI智能体 天工Skywork桌面版。支持本地文件处理无需上传云端在本地虚拟机执行,强调隐私安全。集成Claude Opus 4.5、Gemini 3 Pro等模型,跨格式办公自动化,Windows系统。需购买Basic或Plus会员启用。 2026年2月2日,SpaceX 宣布 与xAI合并。计划在太空中建数据中心,用太阳能与太空散热降低AI成本,解决地面的电力/散热/土地问题。 2026年2月2日,阶跃星辰 发布开源 通用语言模型 Step 3.5 Flash。总参数196B,激活参数11B,256K上下文,MoE架构与滑动窗口注意力优化,专为Agent场景设计,可端云协同,或端侧运行保护隐私,本地化AI任务执行。 2026年2月2日,镜识科技 发布 双足人形机器人 Bolt。高1.75m重75 kg,跑步最高速度10m/s,为当时全球最快双足人形机器人。适用于高动态运动研究与极限场景测试。命名致敬短跑名将尤塞恩·博尔特(Usain Bolt)。 2026年2月2日,宇树科技 宣布 双足人形机器人 宇树G1 在-47.4℃环境中完成104公里自主行走测试,支持北斗卫星厘米级导航与自适应路径规划。适用极地科考、高寒救援、边防巡逻等极端环境任务。 2026年2月2日,特斯拉 发布 双足人形机器人 擎天柱Optimus V3。高1.73m重57kg,全身自由度45个,行走1.2米/秒 ,负载20kg。观察式自主学习,无需人工编程,单个动作学习周期压缩至2.5小时;22自由度灵巧手定位误差0.02mm;动态平衡能力升级。4680电池,工作时长8–10小时。单台成本目标小于2万美元,远期规划年产100万台。2026年底启动量产,2027年面向公众销售。 2026年2月1日,优必选 发布开源 具身智能模型 Thinker。参数4B,具备任务规划、空间建模、时序推理、动作生成、环境反馈闭环能力 ,专为工业人形机器人设计。 2026年1月30日,生数科技 发布 通用视频模型 Vidu Q3。一次生成16秒1080P音视频内容,文生视频与图生视频且同步生成音频。可直接生成包含镜头语言、角色对话、背景音效的短片,降低视频创作门槛。 2026年1月30日,蚂蚁灵波科技 发布开源 具身智能模型 LingBot-VA。用自回归视频预测让机器人在动手之前推演未来几秒画面再执行动作,适用于清洗擦试管、拧螺丝、折衣服等精细操作场景。 2026年1月29日,谷歌DeepMind 发布 人类基因组模型 AlphaGenome。 专注于人类基因组中占比98%的非编码区调控预测,成功解码这98%长期未被理解的"基因组暗物质",用于复杂疾病风险分析。登《Nature》封面。通过API向全球科研机构开放(非商业用途)。2025年6月25日首次披露。 2026年1月29日,360 发布 AI软件 纳米漫剧流水线。整合剧本解析、资产生成、分镜制作、动态合成等环节,单集生产时间压缩至30分钟至1小时。一站式AI漫剧智能体生产平台,提升内容创作效率。 2026年1月29日,蚂蚁灵波科技 发布开源 世界模型 LingBot-World。支持10分钟视频生成、1秒内交互延迟。 2026年1月28日,蚂蚁灵波科技 发布开源 空间3D模型 LingBot-Depth。参数小于1B,空间感知看清透明反光物体,联合奥比中光打造新一代3D相机。 2025年1月27日,蚂蚁灵波科技 发布开源具身智能模型 LingBot-VLA。参数约30B,支持9种机器人构型的跨本体、跨任务执行。 2026年1月27日,月之暗面 发布开源 通用语言模型 Kimi K2.5。支持多模态输入理解 ; Agent集群(AgentSwarm) 可动态生成并调度最多100个子智能体, 单任务支持1500+工具调用;视觉编程;256K上下文。MoE架构,总参数1000B,激活参数32B。 2026年1月26日,阿里通义 发布 Qwen3-Max-Thinking,加强深度推理和Agent能力,适用科研、企业决策、自动编程等高价值场景。 2026年1月22日,百度 发布 通用多模态模型 ERNIE 5.0。参数量2.4T(万亿),原生多模态统一建模,输入/输出 覆盖文本、图像、音频、视频4种模态,支持任意组合的跨模态理解与生成。支持 深度/宽度/稀疏度 3种弹性推理,适配云端、边缘设备、手机等,可在移动设备上运行多模态任务。 2026年1月19日,银河通用 发布 轮式人形机器人 Galbot S1。搭载全自主零遥操的具身搬运模型,双臂负载50公斤,整机IP54级防护,双电池冗余与自助换电实现工业环境中7×24小时连续作业。适用于仓储、产线等工业重载搬运场景。 2026年1月15日,阿里通义 更新发布 AI软件 千问。全面接入淘宝、支付宝、飞猪、高德等阿里生态业务,使千问Agent实现购物、出行导航、政务服务等一系列实际生活办事需求。 2026年1月13日,爱诗科技 发布 世界模型 PixVerse R1。支持1080P视频实时生成,自回归流式生成与瞬时响应。所想即所见的交互,可用于游戏、互动娱乐与创意共创等。 2026年1月10日,个人开发者Peter Steinberger 发布开源 AI智能体 Clawdbot,1月27日更名Moltbot,1月30更名OpenClaw为稳定版。作者用AI协同开发耗时一周完成。主动式AI Agent,长期记忆,用聊天软件发指令自然语言直接操控电脑本地应用(控制浏览器/读写文件/调用API/运行脚本等),系统权限较高;可本地运行在自有设备(PC/服务器/Mac mini)上, 数据不上传云端,解决隐私泄露风险;插件生态丰富。实现从语言理解到物理执行的闭环。网友称"开源版贾维斯"。 2026年1月6日,英伟达 发布 AI平台 薇拉•鲁宾(Vera Rubin)。 Rubin架构,6款协同芯片包括Vera CPU、Rubin GPU、NVLink6交换机、ConnectX-9 SuperNIC、BlueField-4 DPU、Spectrum-6以太网交换机。为物理AI、数字孪生、具身智能等前沿领域提供高带宽低延迟的数据中心级算力支持。 2026年1月5日,瑞士联邦理工学院、美国杜克大学、葡萄牙高等理工大学联合研究团队 发布开源 仿生机器人 仿斑马鱼机器鱼ZBot。基于斑马鱼幼鱼的神经网络模型构建,复现其游泳行为,验证间歇性游泳提升能效的新机制。为神经行为学研究与仿生机器人设计提供新方法。 2025年12月31日,月之暗面 发布开源 通用语言模型 Kimi K2 Thinking。Agentic Model,智能体专项优化,支持多智能体协同与300轮以上工具调用。用于复杂任务的端到端自动化处理(如金融建模、法律分析等)。 2025年12月31日,商汤科技 发布 通用语言模型 日日新V6.5(SenseNova V6.5 Pro)。支持多模态输入理解,NEO多模态架构与跨视角预测训练,视觉推理能力突出;发布AI软件 Seko2.0(剧集智能体) 、SenseCare(医疗影像) 、AI办公助手(集成至WPS)、 电商直播虚拟主播3.0。 2025年12月30日,MiniMax 发布开源 通用语言模型 MiniMax M2.1。MoE架构,总参数100B,激活参数10B,支持9种编程语言,支持全流程编程开发任务,可在消费级GPU运行。 2025年12月29日,阿里通义 发布开源 通用语言模型 QwenLong-L1.5。基于Qwen3-30B-A3B-Thinking,创新内存增强架构,约3–4M tokens的上下文。 2025年12月28日,微博 发布开源 通用语言模型 VibeThinker-1.5B。在多个数学评测得分中高于DeepSeek-R1-0528-685B。单次总训练成本7800美元,降低科研与开发门槛,支持一键部署,适配数学推理、文本处理、编程等场景。 2025年12月27日,百度 发布 通用语言模型 文心4.5;更新发布 文心智能体平台。新平台优化智能体自主建模与决策规划能力,新增金融、制造、能源等行业定制化模块,支持企业级商用部署。 2025年12月25日,阿里通义 更新发布开源 通用图像模型 Qwen-Image-Edit-2511,用于图像编辑。在2509版本基础上优化人脸身份保留、全局一致性,解决“图像漂移”问题。 2025年12月23日,智谱AI 发布开源 通用语言模型 GLM-4.7。约400B参数,混合专家(MoE),专注复杂编程任务,如3D游戏开发、全栈Web应用、工具链协同等场景。 2025年12月20日,摩尔线程 发布 AI基础硬件 MTT AIBOOK(笔记本电脑)、长江(终端SoC芯片)、华山/庐山(GPU芯片)。长江AI 芯片集成CPU+GPU+NPU ,主频2.55GHz,50TOPS-INT8算力。MTT AIBOOK搭载长江芯片,内置Qwen3-8B大模型+数字人小麦, 支持Windows/Linux/Android多系统,14英寸2.8K OLED,32G内存+1T固态硬盘版9999元。华山GPU芯片用于AI训推一体,支持十万卡集群。庐山GPU芯片用于图形渲染,第二代光追引擎。 2025年12月18日,快手可灵 发布 通用图像视频模型 Kling-Omni系列。包括 Video O1(视频)、Image O1(图像)、Video 2.6(音画同步)、Digital Human 2.0(数字人)。通用生成框架,可用多模态内容输入直接合成视频。适用视频创作与智能推理任务。 2025年12月17日,阶跃星辰 发布 AI智能体 Step-GUI。包含参数4B-Edge(开源)、8B-Base、22B-Pro三个版本。可离线设备端GUI自动化操作任务。 2025年12月12日,蚂蚁 发布开源 通用语言模型 LLaDA2.0。 包含16B参数的LLaDA2.0-mini和100B参数的LLaDA2.0-flash,均MoE 架构,扩散语言模型。推理速度535tokens/秒,比传统自回归模型快2.1倍,适用于高效部署、代码生成与智能体任务。 2025年12月10日,Anthropic 发布 通用语言模型 Claude Opus 4.5。主打高阶编程与工程自动化、智能体(Agent)任务编排、真实计算机操作(Computer Use),支持调用API、操作终端、控制浏览器、读写文件等。 2025年12月1日,深度求索 发布开源 通用语言模型 DeepSeek-V3.2(正式版) 和 DeepSeek-V3.2-Speciale(研究版)。Speciale版融合DeepSeek-Math-V2的定理证明能力,通过高Token消耗长思考增强实现复杂任务推理,专用于数学竞赛与高级科研场景。 2025年11月25日,金山办公和华中科技大学 联合发布 文档解析语言模型 MonkeyOCR v1.5。文档解析性能突出。支持文本、表格、公式、图像类型解析,输出格式兼容Markdown、HTML、JSON等,适合办公文档处理、科研文献整理等需求,可对接企业OA系统与科研工具。 2025年11月22日,谷歌DeepMind 发布 AI智能体 SIMA 2。集成Gemini模型,支持多模态交互,在3D游戏中任务完成率达62%。适用于物理世界交互与游戏自动化。 2025年11月21日,Meta 发布开源 3D模型 SAM 3D。单张2D图像生成3D模型。已集成至Instagram和Facebook Marketplace的View in Room功能,用户可将商品3D模型叠加到真实房间中预览,提升电商体验。 2025年11月20日,北京大学团队 发布 物理AI系统 AI-Newton。用“符号回归”方法,由实验库和理论库构成知识库,用物理语言(DSL)将方程转化为可解析的抽象语法树,不依赖质量、能量等先验概念,从原始数据自主提取基础元素、推导物理定律。其成功重新发现牛顿第二定律、能量守恒定律等核心物理规律,模仿人类科学家“提出假说-严谨验证”,灵活推理,实现人机协同科研。 2025年11月19日,OpenAI 发布 代码语言模型 GPT-5.1-Codex-Max。专为复杂编程任务优化的Agentic模型。百万token上下文,可连续运行超24小时,适用于大型代码库重构、自动化测试、多文件项目维护等高级软件工程场景。 2025年11月19日,谷歌 发布 通用语言模型 Gemini 3 Pro。多模态输入理解,稀疏混合专家架构,上下文1M的token,输出token最高64K,可深度思考模式。用于跨学科博士级难题求解与复杂逻辑推理。 2025年11月18日,Physical Intelligence(PI) 发布 具身智能模型 π*0.6。基于π0.6基础模型的视觉-语言-动作(VLA)模型,用RECAP(基于优势条件策略的经验与纠错强化学习)方法,解决模仿学习的累积错误难题,吞吐量较基础π0.6模型提升2倍,可连续执行任务数小时。 2025年11月18日,xAI 发布 通用语言模型 Grok 4.1,同步上线 网页与移动端(iOS/Android)。降低幻觉率至4.22%,强化情感理解与创意输出能力。 2025年11月18日,字节跳动Seed团队 发布开源 通用3D模型 Depth Anything 3(DA3)。单Transformer架构,无需复杂硬件或已知相机参数,可从任意视觉输入(单图/多视角/视频)中实现空间重建。适用建筑设计、游戏建模、AR/VR、数字孪生等场景。 2025年11月18日,谷歌DeepMind 与 Google Research团队 发布 气象 AI 模型 WeatherNext 2。Functional Generative Network(FGN)架构,可1分钟内完成全球未来 15天的高分辨率天气预测,模型已集成至谷歌搜索、Gemini、Maps等产品,应用于极端天气预警、农业生产、能源调度等场景。 2025年11月18日,蚂蚁集团 发布 AI智能体软件 灵光。Agentic架构,可动态调度图像、3D等专用智能体与工具,生成可交互定制化小应用,支持多模态内容输出,核心“灵光对话”“灵光闪应用”“灵光开眼”功能,同步上线安卓苹果应用商店。 2025年11月17日,阿里 发布 AI软件 千问。前身是 通义,基于Qwen3系列模型,整合阿里生态资源,支持多模态内容呈现,定位个人AI助理,同步在各应用商店上架,开放iOS、Android、网页及PC平台,向中国内地普通用户与开发者免费开放。 2025年11月14日,小米 发布开源 AI系统 Xiaomi Miloco(Xiaomi Local Copilot)。定位AI智能管家,搭载自研MiMo-VL-Miloco-7B模型,支持多模态输入,可用米家摄像头识别用户活动与手势,支持 语音+手势双交互,实现跨生态智能家居联动,支持本地部署。 2025年11月13日,谷歌DeepMind 发布 AI智能体 SIMA 2。集成Gemini 2.5 Flash-Lite,支持自然语言、草图、Emoji等多模态指令,在3D游戏中复杂任务完成率达62%(接近人类 75%)。未来有望将技能迁移到真实机器人系统。 2025年11月13日,OpenAI 发布 通用语言模型 GPT-5.1,分Instant和Thinking版本,逐步向付费用户推送,免费用户于11月20日前可用。 2025年11月5日,斑马口语 发布 AI软件 斑马口语AI外教,为6–12岁儿童,基于猿力模型,可动态调整方案实现个性化教学,课后可自动生成学习报告。 2025年11月2日,乐聚机器人 发布 人形机器人 夸父。高约1.73米,重约63.5千克,全身自由度超41个,可连续跳跃高度超20厘米,搭载5G-A技术。 2025年11月1日,普罗宇宙 发布 轮式具身机器人 大白2.0。配套四款标准化末端执行器及混合驱动灵巧手“普罗小灵”。提升工序自动化水平,解决复杂场景理线等需求。 2025年11月1日,OpenAI 发布 智能助手 Pulse移动版。基于ChatGPT,可夜间异步梳理数据,推送个性化简报,可连接日历、邮箱应用,可赞踩反馈优化内容,向ChatGPT Pro订阅用户开放。 2025年11月1日,Anthropic 发布 通用语言模型 Claude Haiku 4.5。成本为Sonnet4的三分之一,支持数学推理和编码任务,轻量化。 2025年10月31日,月之暗面 发布 语言优化模型 Kimi Linear。开源KDA内核与2个模型检查点,1M token场景下KV缓存减少75%,解码吞吐量提升6倍,为长文本处理降低内存算力成本。 2025年10月31日,智源研究院 发布 世界模型 悟界·Emu3.5。34B参数,Transformer架构,离散扩散自适应,图像推理速度提升。 2025年10月31日,OpenAI 发布 代码语言模型 Aardvark。代码安全领域,可自主分析代码库、建立威胁模型、验证漏洞可利用性,通过多步演算生成修复补丁,能与OpenAI Codex集成,可为非商业开源项目提供免费扫描服务。帮助开发者快速定位漏洞,提升代码安全性与修复效率。 2025年10月31日,Lightricks 发布 通用视频模型 LTX-2。可生成20秒4K叙事视频,支持音画同步,兼容多输入方式,可在消费级GPU上本地运行。降低专业级视频创作的设备门槛。 2025年10月31日,Google 发布 AI系统 无障碍街景StreetReaderAI。为概念验证原型,基于Gemini构建双系统,支持语音/键盘交互与自然语言对话。帮助视障用户自主探索街景提升出行便利性。 2025年10月30日,MiniMax 发布 语音模型 Speech 2.6,分 HD高清版 和 Turbo极速版,各细分 实时同步 与 异步长文本 子版本。生成延迟低于250ms,支持40种语言的网址邮箱电话号码等非标准文本格式直接解读,复刻音色还原口音说话节奏等细节。语音交互、有声内容创作等,客服机器人、虚拟助手、有声读物等场景。 2025年10月29日,Cursor 发布 代码模型 Composer。随Cursor 2.0版本同步上线。混合专家MoE架构,代码推理、自主工具调用,输出token超200个/秒,支持8个智能体在独立工作区并行协作,新增内嵌浏览器工具与语音控制功能。 2025年10月29日,英伟达 发布开源 通用全模态模型 OmniVinci。参数9B,用OmniAlignNet、TEG、CRTE核心架构。提供跨模态融合方案,适配视听联合感知、语音交互、机器人指令等多场景全模态应用开发。 2025年10月29日,IBM 发布开源 AI模型 Granite4.0Nano。Mamba-2与Transformer混合架构,含8款细分模型,参数0.035B-0.15B。为边缘设备、低延迟场景提供 轻量化 方案。 2025年10月29日,Cartesia 发布 语音模型 Sonic-3。状态空间模型(SSM)架构,延迟90ms,端到端总响应时间190ms以内,支持42种语言及500余种音色,情感精细控制、语音克隆、自定义发音。适用客服、虚拟伴侣等实时对话场景。 2025年10月28日,中科大LDS实验室何向南王翔团队和AlphaLab张岸团队 联合发布开源 MiniOneRec推荐框架。端到端,验证生成式推荐的规模效应,适配电商、内容推荐等场景,降低研发门槛,打破技术垄断。 2025年10月28日,Adobe 发布 图像模型 Firefly Image 5。支持400万像素输出,照片级真实感生成,文本指令编辑、分层图像编辑。依托Firefly平台新增AI配乐、旁白生成及时间轴视频编辑工具。助力其同一平台完成图、文、音视频一体化创作,提升跨媒体内容生产效率。 2025年10月28日,AI21 Labs 发布开源 通用语言模型 Jamba Reasoning 3B。“2层注意力机制+26层Mamba”的混合SSM-Transformer架构,256K上下文,处理token最大1M。轻量化可本地运行,处理速度提升,适配设备本地检索增强(RAG)、文档解析、智能体工作流等场景。 2025年10月28日,蚂蚁百灵大模型团队 发布开源 通用语言模型 Ring-flash-linear-2.0-128K。Ring系列思考模型。激活参数6.1B,在代码生成、智能代理方面表现提升。 2025年10月27日,北京大学智能学院 发布 具身智能模型 通智大脑。Real2Sim2Real(现实-仿真-现实)闭环技术路径,支持虚拟空间训练与现实世界技能迁移。 2025年10月27日,蚂蚁百灵大模型团队 发布开源 AI模型 Ring-mini-sparse-2.0-exp。Ring系列高效推理模型。适配复杂长序列解码场景。 2025年10月27日,美团 发布开源 视频模型 LongCat-Video。参数13.6B,定位“世界模型”,Diffusion Transformer(DiT)架构,可文生视频、图生视频、视频续写,可产出5分钟、720P分辨率、30fps帧率的视频。 2025年10月27日,MiniMax 发布开源 编码与智能体优化型语言模型 M2。专为编码与智能体工作流优化。总参数230B,混合专家MoE架构,上下文Token最大204.8K,输出Token最大131.1K。适合多文件编辑、工具链协同等场景。 2025年10月26日,IEEE机器人与自动化学会 在北京举办 人形机器人格斗挑战赛。国际智能机器人与系统会议(IEEE IROS 2025)期间,以开源的宇树G1双足人形机器人为统一平台, 由高校与科研团队参与,通过直拳/勾拳/侧踢/闪避/摔倒自恢复等动作,聚焦运动控制与AI算法,同济大学团队获冠。 2025年10月24日,加速进化 发布 人形机器人 Booster K1。高95cm、重19.5kg,22个自由度,分极客、教育、专业3个版本,AI算力48-200Tops,续航30-80分钟,支持无代码与二次开发。配套API接口、开源框架及Agent应用平台,适配教学科研展演等场景,“百城万校”计划。首批100台售价2.99万元起。 2025年10月23日,松延动力 发布 人形机器人 Bumi小布米。京东预售价9998元。小尺寸,高94cm、重12kg,21个自由度,可行走奔跑舞蹈等动作,支持图形化编程开发;为普通家庭教育机构提供选择。 2025年10月21日,加速进化 发布 双足人形机器人 Booster K1。高95cm、重19.5kg,家庭陪伴与校园教学场景,内置多种标准 Agent,提供无代码开发与示教学习能力,具身智能入门与二次开发平台。于10月24日在2025加速进化生态大会公示。 2025年10月21日,北京通用人工智能研究院 发布 AI智能体 通通。用于具身智能,可自主生成任务与价值驱动行为模式,从被动执行到主动规划。 2025年10月21日,OpenAI 发布 AI软件 ChatGPT Atlas 浏览器。以ChatGPT为核心嵌入浏览全流程,与谷歌Chrome浏览器竞争。新增“记忆”与“代理模式”。目前仅支持M系列芯片的Mac电脑,Windows及移动版后续推出,代理模式向ChatGPT Plus、Pro及Business用户开放。简化网页操作流程,信息整合与自动化任务处理。 2025年10月21日,AxeleraAI 发布 AI基础硬件 Europa。AI推理处理器(AIPU),用于生成式与视觉推理场景。峰值214TOPS、功耗45W、内存带宽200GB/s;可扩展内存,单芯片16GB至四芯片256GB。支持从边缘设备到企业服务器部署。 2025年10月20日,宇树科技 发布 人形机器人 Unitree H2。高1.8m重70kg,增加仿生人脸。 2025年10月17日,中兴通讯 发布 AI模型 Nebula-GUI。可自主操作30余款主流APP,常用场景平均准确率超90%。 2025年10月16日,智元机器人 发布 轮式人形机器人 精灵G2。高1.5m、重80kg,全身50个自由度,本地算力2070 TFLOPS,集成空间感知系统,支持多模态语音交互,2条7自由度工业机械臂,亚毫米精度(±0.02mm)力控操作,适配工业制造/物流/轨道/导览等场景。 2025年10月15日,科大讯飞 更新发布 机器人超脑平台。集成星火大模型,支持多人多模态降噪、高情商对话与连续指令精准响应。已连接超500家机器人企业。 2025年10月12日,新益昌 发布 轮式人形机器人 HOSON-Robot。自研RMC100“小脑”运动控制器、灵巧手(11个自由度)及关节模组。 2025年10月9日,Figure 发布 人形机器人 Figure 03。高1.68米,重60千克,满电可连续工作5小时,手掌嵌入摄像头,指尖能感知3克压力,柔性织物外壳。适配家庭和酒店等场景。 2025年10月9日,云深处科技 发布 人形机器人 DR02。高1.75m,重75kg,不含末端执行器共31个自由度,双臂负载10kg,整机可背负20kg,IP66级防水防尘,可在-20℃至55℃温度稳定作业,275TOPS算力,适配户外作业。 2025年9月30日,蚂蚁 发布开源 通用语言模型 Ring-1T-preview。万亿参数推理模型,Ling-2.0 MoE架构。适用于复杂数学与编程推理任务。 2025年9月30日,OpenAI 发布 通用视频模型 Sora 2。可生成10秒视频并同步生成对应音频,可身份验证及形象插入(客串),推出同名社交软件,降低视频创作门槛。 2025年9月30日,智谱AI 发布开源 通用语言模型 GLM-4.6。总参数355B、激活参数32B,支持200K上下文,在编程、长文本处理、推理及智能体应用等方面提升。 2025年9月29日,Anthropic 发布 通用语言模型 Claude-Sonnet-4.5。主打编码、智能体构建及计算机使用能力,可连续工作超30小时处理多步骤任务,在金融、法律、医学等专业领域表现突出,优化安全性与对齐性。 2025年9月29日,深度求索 发布开源 通用语言模型 DeepSeek-V3.2-Exp,实验性版本。自研稀疏注意力机制(DSA),主打长文本训练与推理效率优化,API成本较前代降低50%以上。 2025年9月28日,腾讯 发布开源 通用图像模型 HunyuanImage-3.0。生图模型,参数80B,可用世界知识推理解析千字级复杂语义及生成长文本,适配广告设计、创意创作等场景。 2025年9月28日,阿里通义 更新发布开源 通用图像模型 Qwen-Image-Edit-2509。增强编辑一致性、支持多图融合、集成ControlNet、提升文字字体/颜色编辑能力。 2025年9月26日,OpenDataLab与上海AI实验室 联合发布 语言模型 MinerU-2.5。用于文档解析,参数1.2B,“先全局后局部、先结构后语义”的两段解耦,可将PDF等格式文档转化为Markdown、JSON等结构化数据。 2025年9月25日,谷歌DeepMind 发布 具身智能模型 Gemini Robotics 1.5、Gemini Robotics-ER 1.5。前者是视觉-语言-动作(VLA)模型,将视觉、文本数据转化为机器人动作指令,可跨机器人本体学习;后者是视觉语言(VLM)模型,物理世界推理,能调用数字工具并制定多步骤任务计划,二者协同工作形成感知-推理-决策闭环,具备神经-符号融合推理能力,在空间理解基准测试中表现突出。 2025年9月25日,月之暗面 发布 AI智能体 Kimi OK Computer。基于Kimi K2模型,支持虚拟电脑环境与20+工具协同。可独立完成数据分析、代码编写与网站部署全流程。 2025年9月23日,快手 发布 通用视频模型 可灵Kling-2.5-Turbo。可文生视频、图生视频,在文本理解、动态效果、风格保持及美学方面提升,生成成本较前代下调30%。 2025年9月19日,xAI 发布 通用语言模型 Grok-4-Fast。主打速度与成本效率,2M token上下文,可处理文本图像音频等多模态输入,成本较同级降低40%,用户可免费无限制使用。 2025年9月18日,华为 发布 AI基础设施 昇腾Atlas 950 SuperPoD超节点。自研灵衢互联协议,单柜64卡为基本单元,最大支持8192张昇腾卡高速互联;提供FP8算力达8 EFLOPS,FP4算力达16 EFLOPS;总内存容量1152TB;灵衢全光互联带宽16.3 PB/s;RTT通信时延3微秒。面向万亿级参数大模型训练与高并发推理场景。于2026年7月17日世界人工智能大会(WAIC)首次公开展出真机。 2025年9月16日,腾讯 发布 通用3D模型 混元3D 3.0。采用3D-DiT分级雕刻技术,支持36亿体素建模,人物面部细节达真人手办级。适用于游戏、电商、AR/VR行业AI创作。 2025年9月15日,阿里通义 发布 语音模型 通义语音 Fun系列,包括 语音识别系列模型 Fun-ASR、语音合成与克隆系列模型 Fun-CosyVoice,支持10+种语言及1000个以上热词定制,部分子模型支持零样本音色克隆,可调音量、语调与语速。 2025年9月12日,阿里通义 发布开源 代码语言模型 Qwen3-Coder;发布 通用语言模型 Qwen3-Max(正式版)、Qwen3-VL,Qwen3-Next-80B-3B;发布 通用多模态模型Qwen3-Omni,可实时音视频输入输出;发布 通用视频图像模型 通义万相Wan2.5-Preview系列,涵盖文生视频、图生视频、文生图和图像编辑4个子模型,1080P视频生成及音画同步,可生成中英文字和图表、对话式图像编辑。发布AI软件 通义百聆(Tongyi Bailin),全能语音助手,支持多地方言、情感语气调节,用于客服、直播、有声读物、儿童陪伴等场景。都在阿里云栖大会发布。 2025年9月11日,万国邮政联盟 发布 AI智能体(无具体名称),运行于万国邮联统一数据平台,可整合邮联所有相关大数据及其他数据源分析,为政策、监管和运营变革提议,测试潜在解决方案,助力国际邮政发展。 2025年9月9日,腾讯 发布开源 通用图像模型 HunyuanImage-2.1。17B参数,支持2K生成,FP8量化需24GB显存运行,降低视觉设计创意门槛。 2025年9月9日,百度 发布 通用语言模型 文心大模型X1.1(ERNIE-X1.1),基于文心4.5模型,主打强推理思考、事实性、指令遵循及智能体和工具调用能力。 2025年9月9日,Vidu 更新发布 视频生成模型 Vidu Q1 的图像生成功能,支持同时7张参考图。 2025年9月9日,自变量机器人 发布开源 具身智能模型 WALL-OSS。4.2B参数,视觉-语言-动作(VLA)模型,“共享注意力+专家分流”架构,具备视觉空间推理、多语言指令遵循、长任务规划及动作修正能力,RTX 4090单卡即可部署。 2025年9月6日,阿里巴巴 发布 Qwen3-Max-Preview(Instruct),总参数达到1万亿,在中英文理解、复杂指令遵循、工具调用等方面增强,减少知识幻觉。 2025年9月4日,OpenAI 更新发布 ChatGPT新功能 分支对话(Conversation Branching),允许用户在交流中探索多个对话方向,而无需重启或重写之前的讨论。 2025年9月4日,字节跳动 发布 agent智能体 UI-TARS-2,基于Seed-thinking-1.6,原生-通用-跨平台的GUI智能体,能在电脑、手机、网页、终端,甚至游戏里自主完成复杂任务。 2025年9月3日,上海人工智能实验室 发布 通用语言模型 InternVL3.5-241B-A28B。多模态输入理解,采用ViT–MLP–LLM架构,支持GUI智能体与具身智能任务。适用于Windows、Mac等平台的自动化操作与机器人物理交互。 2025年9月3日,快手 发布开源 推理思考模型 Keye-VL 1.5,能看懂视频,支持跨模态推理,128k上下文,0.1秒视频定位。 2025年9月2日,腾讯 发布开源 世界模型 混元Voyager(HunyuanWorld-Voyager),可原生3D重建的长漫游,可将视频直接导出为3D格式。发布开源 智能体框架 Youtu-agent,不需要训练模型、不依赖闭源API,用开源模型,自动配置生成,全场景适配。 2025年9月1日,字节跳动 发布 机器人模型 Robix,一个模型搞定机器人推理、任务规划和自然语言交互。 2025年9月1日,腾讯 发布开源 语言翻译模型 Hunyuan-MT-7B,支持33个语种、5种民汉语言/方言互译,轻量级。在国际计算语言学协会(ACL)WMT2025比赛中,全部31个语种比赛中的30个第1名。 2025年9月1日,美团 发布开源 语言模型 Longcat-Flash-Chat,560B的混合专家(MoE)模型,"零计算专家"设计实现效率与性能的双重优化,可调用外部工具完成复杂智能体任务。 2025年8月31日,浙江大学和美团 联合发布开源 智能体 UItron,面向中文场景,可自动操作手机、电脑和浏览器,自主完成如"播放指定歌手歌曲"等复杂任务。 2025年8月29日,蚂蚁集团联合研究团队 发布开源 医学AI智能体 MedResearcher-R1,在权威医疗基准测试MedBrowseComp中分数超过o3、Gemini2.5Pro等通用模型。 2025年8月29日,xAI 发布 语言编程模型 Grok Code Fast 1,主打快速经济,256K上下文,可在众多AI IDE及插件中使用。 2025年8月28日,腾讯 发布开源 视频音效生成模型 HunyuanVideo-Foley,端到端,专为视频内容创作打造的音频生成工具,提供对应画面和文字的配音能力。 2025年8月26日,谷歌Google 发布 图像编辑模型 Gemini 2.5 Flash Image,别名 nano-banana,图像编辑能力显著提升,可在Gemini和Google AI Studio中免费用。 2025年8月26日,阿里巴巴 发布开源 视频生成模型 Wan2.2-S2V,参数量14B,由音频驱动生成视频,一张图和一段音频可生成数字人视频。 2025年8月26日,Anthropic 发布 浏览器agent智能体 Claude for Chrome,可作为浏览器的扩展程序直接使用,可自动完成各种复杂网页操作任务。 2025年8月26日,英伟达Nvidia 发布开源 语言模型 Jet-Nemotron,基于后神经架构搜索,准确率与生成速度相比其他架构显著提升。 2025年8月25日,群核科技 发布开源 空间语言模型 SpatialLM1.5 和 空间生成模型 SpatialGen,三维空间视角一致性提升,漫游自由度和真实感提升。 2025年8月25日,智象未来 发布开源 图像编辑模型 VAREdit,基于视觉自回归(VAR)架构,能在遵循指令的前提下做到“指哪打哪”,提升编辑精准度与生成速度。 2025年8月25日,阿里巴巴 发布开源 AI智能体框架 Mobile-Agent-v3,自动化操作手机、电脑,支持知识演进、任务规划、子任务执行与反思推理的多智能体协作。 2025年8月25日,潞晨科技 更新发布 Video Ocean视频制作Agent智能体 ,首个接入GPT-5,包含 脚本策划、视觉合成、配音字幕模块。 2025年8月24日,xAI 发布开源 Grok 2.5。 2025年8月22日,极峰科技 发布 工业智能体平台 河谷,基于工业时序模型 Geegobyte-g1,推出一系列通用岗位Agent数字技术工人,支持工厂自定义的Agent角色等,落地工业场景。 2025年8月22日,OpenAI联合Retro Bio 发布 蛋白质模型 GPT‑4b micro,基于GPT-4o,专对生命科学领域的蛋白质工程设计任务做了优化。 2025年8月22日,阿里巴巴 发布 AI编程工具 Qoder,理解整个代码库,可一次检索10万个代码文件。 2025年8月21日,百度 发布 视频生成模型 蒸汽机2.0(MuseSteamer 2.0),可生成5s或10s的有声画面。 2025年8月20日,字节跳动 发布开源 推理思考模型 Seed-OSS-36B,512K上下文。 2025年8月20日,智谱AI 更新发布 Agent智能体 AutoGLM 2.0,全球首个,免费使用,由GLM-4.5和GLM-4.5V驱动,通用,具备推理、代码及多模态输入处理能力。 2025年8月19日,深度求索 更新发布 语言模型 DeepSeek V3.1,128K上下文,参数约685B。 2025年8月19日,阿里巴巴 发布开源 图像编辑模型 Qwen-Image-Edit,基于Qwen-Image-20B,支持文字修改、新增、消除、重绘、修改元素、IP编辑、视角切换、风格迁移等。 2025年8月19日,英伟达Nvidia 发布开源 语言模型 Nemotron Nano v2,参数量9B,较同量级模型速度提升。 2025年8月19日,淘天集团 发布开源 视觉语言动作(VLA)模型 CombatVLA,参数量3B,3D动作游戏专用,在动作角色扮演游戏的战斗任务中,成功率超GPT-4o和人类玩家。 2025年8月19日,中科院和清华大学和阶跃星辰等联合 发布开源 AI智能体框架 SE-Agent,自进化(Self-Evolution)框架。 2025年8月18日,智元机器人 发布 四足机器人D1系列(Pro/Edu/Ultra)、清洁机器人C5、灵巧手OmniHand(灵动/专业)。 2025年8月18日,快手 发布 Agent智能体 Kwali,邀请码内测中,超级员工,可智能客服、直播辅助、多语言翻译等核心功能,一句话生成完整营销视频。 2025年8月18日,百度 发布 Agent智能体 GenFlow2.0,100+AI专家Agent同时开工,可随时打断补充资料,全端通用,依托百度文库、百度学术自身的资料,已上线百度文库Web端/APP等。 2025年8月18日,心影随形科技 发布 AI产品 逗逗AI 1.0,主打"陪你游戏、伴你生活"的AI陪玩游戏伙伴,基于实时VLM,具备多模态输入长期记忆,已对所有游戏通用支持,也可一起看剧、购物、上网课,支持手机和电脑。 2025年8月16日,北京大学 发布开源 语言模型 Fairy-plus-minus-i,别名 iFairy,参数量 700M和1.3B,用复数{±1,±i}对模型权重进行2-bit量化,实现模型压缩与加速,表现超同级LLaMA模型。 2025年8月15日,Menlo Research 发布开源 模型 Jan-v1,参数量4B,基于Qwen3-4B-Thinking,用于网络搜索和深度研究,类似Perplexity,免费,支持个人电脑本地部署。 2025年8月15日,阿里巴巴 发布开源 Agent智能体 WebWatcher,多模态输入Deep Research Agent,整合网页浏览、图像搜索、代码解释器、内部OCR等多工具。 2025年8月15日,腾讯 更新发布开源 世界模型 HunyuanWorld 1.0 lite,混元3D世界生成模型,可在消费级显卡运行,可导出能二次编辑的3D mesh。 2025年8月15日,昆仑万维 发布 音频模型 Mureka V7.5,中文音乐生成与描述性TTS。 2025年8月14日,谷歌Google 发布开源 通用语言模型 Gemma 3 270M(0.27B),性能超过同级模型,可在手机等终端本地使用。 2025年8月14日,字节跳动 发布开源 AI智能体框架 M3-Agent,多模态输入,能听会看,具备长期记忆,能随时间的推移积累知识。 2025年8月14日,Meta 发布开源 视觉模型 DINOv3,参数量7B,自监督学习。 2025年8月14日,阶跃星辰 发布开源 形式化定理证明模型 StepFun-Prover-Preview-32B和7B,允许模型发现错误、反思、修正错误,直到证明成立。 2025年8月14日,腾讯 发布开源 游戏视频模型 Hunyuan-GameCraft,基于视频模型HunyuanVideo,专为游戏环境设计,一张图轻松变游戏,可在消费级显卡运行。 2025年8月14日,昆仑万维 发布 Agent智能体 Skywork Deep Research Agent v2,多模态输入调研与浏览器智能体。 2025年8月13日,昆仑万维 发布开源 图像模型 Skywork UniPic 2.0,统一多模态输入理解,生成与编辑一体化。 2025年8月12日,昆仑万维 发布开源 世界模型 Matrix-Game 2.0,可交互。发布开源 3D模型 Matrix-3D,场景生成。 2025年8月11日,昆仑万维 发布开源 视频模型 SkyReels-A3,音频驱动的人像视频生成。 2025年8月11日,英伟达Nvidia 更新发布开源 视觉语言推理思考模型 Cosmos Reason 7B,帮助机器人进行任务规划;更新发布 Cosmos Transfer-2和精简版,加速将虚拟场景转化为训练数据。 2025年8月11日,星海图 发布 视觉语言动作(VLA)模型 星海图G0,端到端"慢思考、快执行"的双系统设计,机器人具身智能应用。 2025年8月11日,百川 发布开源 医疗推理模型 Baichuan-M2-32B,支持RTX4090单卡部署,医疗领域表现超过多数开源闭源模型。 2025年8月11日,清华大学联合上海人工智能实验室 发布开源 蛋白质模型 AMix-1,可自主探索规律,看例子学会设计新蛋白,助力发现优质蛋白。 2025年8月8日,动易科技 发布 双足人形机器人 PHYBOT M1。高1.72m重60kg,自由度32个,自研PhyArc系列摆线关节模组 ,峰值扭矩530N·m,可承受5倍瞬时过载。特种作业、物流运输、生产制造等场景。 2025年8月8日,OpenAI 发布 推理思考模型 GPT-5,多模态输入,综合能力全面提升,向所有人开放使用,提供免费、plus和Pro版本。API推出GPT-5、GPT-5 nano、GPT-5 mini版本。多模型一体化系统,三个核心:基础模型解答多数问题,深度推理模型处理复杂难题,实时路由模块来智能调度模型。 2025年8月7日,阿里巴巴 发布开源 语言模型 Qwen3-4B-Instruct-2507 和 推理思考模型 Qwen3-4B-Thinking-2507,256k上下文,可在树莓派等端侧运行。 2025年8月7日,傅利叶 发布 机器人 Care-bot GR-3,全尺寸人形,身高165cm,55个自由度,社交陪伴,辅助陪护。 2025年8月6日,剪映 更新发布 Agent智能体 小云雀,视频生成Agent,智能成片,数字人口播,设计图,更换背景的图片等功能,降低创作门槛。 2025年8月6日,腾讯 发布开源 AI智能体框架 Cognitive Kernel-Pro,提升深度研究Agent表现,最大限度用免费工具,"主智能体+多子智能体"架构。 2025年8月5日,华为 发布开源 昇腾AI GPU软件工具包 CANN,类似英伟达Nvidia的CUDA,为GPU提供相同接口。 2025年8月5日,Anthropic 发布 推理思考模型 Claude Opus 4.1,多模态输入,编程和智能体任务等能力提升。 2025年8月5日,谷歌Google 发布 世界模型 Genie 3,一句话生成可实时交互的3D世界,720P画质,每秒24帧实时导航,分钟级的一致性保持,通用性强,可学习物理,有记忆力。 2025年8月5日,OpenAI 发布开源 推理思考模型 gpt-oss-120b 和 gpt-oss-20b。其中,120b版本可单张80GB GPU运行,性能接近闭源o4-mini;120b版本可16GB内存的消费级设备运行,性能接近o3-mini。 2025年8月5日,百度 发布 AI智能体 数字员工系列,Agent可自主决策、执行、洞察、反哺来完成KPI,覆盖招聘顾问、营销经理、还款助理、课程顾问、促销专员、汽车电销、产品经理等岗位,百度智能云官网使用。 2025年8月5日,阿里巴巴 发布开源 图像模型 Qwen-Image,参数量20B,提升图像中的文字生成表现。 2025年8月4日,高德地图 发布 AI智能体 小高老师,基于阿里巴巴的通义AI,可基于音频、文本、视觉等方式交互,调度内部近百种工具,提供出行服务和解决方案。 2025年8月4日,小米 发布开源 音频模型 MiDashengLM-7B,基于Xiaomi Dasheng音频编码器和Qwen2.5-Omni-7B Thinker自回归解码器,实现对语音、环境音和音乐的统一理解。 2025年8月4日,字节跳动 发布开源 数学模型 Seed-Prover,解决复杂数学问题。 2025年8月4日,芸思智能 发布 AI编程工具 Vinsoo,AI IDE,邀请码内测中,云端安全多Agent团队与本地IDE相结合。 2025年8月2日,360 发布 AI智能体 纳米AI多智能体蜂群,Agent团队协作执行复杂任务,例如可创作最长10分钟视频等。 2025年8月2日,浙江大学 发布 类脑计算机 Darwin Monkey(悟空),超过20亿个脉冲神经元与1000亿突触连接,提供新的AI计算基础。 2025年8月1日,谷歌Google 发布上线 推理思考模型 Gemini 2.5 Deep Think,多模态输入,可在Gemini app开启Deep Think功能,同时生成多个思路后交叉比较、筛选最佳答案,在2025 IMO中得金牌。 2025年8月1日,阿里巴巴 发布开源 语言模型 Qwen3-Coder-Flash,代码编程专用,Agent能力提升,256k上下文可拓展到1M,33GB本地可运行。发布开源 图像模型 Nexus-Gen V2,同时支持图像理解、生成和编辑,整合了VLM和扩散模型。 2025年8月1日,小红书 发布 语言模型 RedOne,社交网络服务(SNS)领域LLM,社交模型,兼顾社交理解与平台规则,洞察理解用户。 2025年7月31日,Black Forest Lab联合Krea AI 发布 图像模型 FLUX.1 Krea [dev],可在Krea Edit免费试用。 2025年7月31日,南洋理工大学联合数美万物、西湖大学 发布 3D模型 Ultra3D,从粗到细的两阶段生成,提升生成效率。 2025年7月31日,字节跳动联合清华大学 发布 语言模型 Seed Diffusion Preview,聚焦代码生成,用离散扩散技术提升推理速度。 2025年7月31日,纽约大学的谢赛宁团队 发布开源 MetaCLIP 2,基于Meta的CLIP,支持300多种语言,增强文本与图像的多模态理解与匹配。 2025年7月30日,谷歌Google 发布 多模态AI模型 AlphaEarth Foundations,生成的地理空间信息整合卫星影像、雷达数据、激光测高、气候模拟等多源时空遥感数据,展现地形、植被、水体等多种属性,实现高精度绘制地球,为科学家提供近乎实时的地球观测。发布 AI产品 Google Earth AI,AlphaEarth Foundations是其核心引擎之一。 2025年7月30日,逐际动力 发布 机器人 LimX Oli,全尺寸人形,165cm身高、31个自由度,分Lite、EDU、Super版本,15.8万元起售。 2025年7月30日,阿里巴巴 发布开源 语言模型 Qwen3-30B-A3B-Instruct-2507。 2025年7月30日,快手联合清华大学 发布开源 语言模型 Archer,参数1.5B,在代码和数学方面较同级表现突出。 2025年7月30日,昆仑万维 发布开源 图像模型 Skywork UniPic,参数1.5B,单模型实现图像理解、文本到图像生成、图像编辑。 2025年7月30日,字节跳动联合南京大学 发布开源 语言模型 CriticLeanGPT,专用于数学领域评估生成的Lean代码是否准确表达了原始数学问题的语义并提供详细解释,基于Qwen2.5。 2025年7月29日,OpenAI 更新发布 ChatGPT功能 学习模式(Study Mode),不再只给答案,而像老师一样引导用户一步步思考问题,可用于教学或辅导来提升学习效果。 2025年7月29日,微软 发布 Edge浏览器功能 "Copilot模式",把浏览器改造成AI智能体Agent,重塑浏览器使用方式。 2025年7月28日,智谱AI 发布开源 通用语言模型 GLM-4.5,总参数355B;GLM-4.5-Air,总参数106B。MoE架构,在代码、Agent智能体、推理等方面表现提升。 2025年7月28日,阿里巴巴 发布开源 视频模型 通义万相Wan2.2,参数量27B,MoE架构,可文生视频、图生视频和混合视频生成。 2025年7月28日,蚂蚁 发布开源 金融语言模型 Agentar-Fin-R1,分8B和32B版本,金融领域专用,基于Qwen3。 2025年7月27日,智元机器人 发布 轮式人形机器人 远征A2-W。可协同完成物料搬运、上料等作业,单台可完成1000箱/班次周转配送,承重14kg。 2025年7月27日,腾讯 发布开源 世界模型 HunyuanWorld 1.0,业界首个开源可沉浸漫游、可交互、可仿真。 2025年7月27日,金山办公 发布 AI产品 WPS AI 3.0,AI智能体 WPS灵犀,原生Office办公Agent,实现PPT、写作、文书、搜索、阅读等各种AI功能整合;发布 AI产品 WPS知识库,基于原生Office文档。 2025年7月27日,腾讯 发布开源 世界模型 混元3D世界模型1.0,兼容传统CG管线,生成可漫游交互的世界,可用于游戏开发、VR、数字内容创作等。 2025年7月27日,商汤科技 发布 具身智能平台 悟能;发布 图像推理模型 日日新V6.5,可边看图边推理。 2025年7月27日,SWE-bench和SWE-agent开发团队 发布开源 AI编程工具 mini-SWE-agent,适合快速本地运行、简洁控制流和稳定评估环境。 2025年7月27日,上海交通大学联合本智激活 发布开源 语言模型 SmallThinker-4B-A0.6B 和 SmallThinker-21B-A3B,为手机等端侧算力、内存、存储设计,不再依赖高端GPU。 2025年7月26日,京东 发布开源 AI智能体 JoyAgent,100%开源,可帮企业实现智能化升级,场景有客服、编码、政务服务、供应链优化、人力管理、热点营销等。
📥 下载地址(文章中间)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。
2025年7月26日,中国卫星气象中心联合南昌大学、华为 发布 空间天气预报模型 风宇,实现太阳风-磁层-电离层的端到端,太阳风模型"煦风"、地球磁场模型"天磁"、地球电离层模型"电穹",用链式训练和可插拔架构,太阳、极光等模型正研发中,涉及太阳、行星际、磁层、电离层等多圈层复杂物理作用。 2025年7月26日,英伟达Nvidia 发布开源 语言推理思考模型 Llama Nemotron Super v1.5, 基于Llama 3.3 70B Instruct,在科学、数学、编程及Agent任务中表现出色。 2025年7月26日,深势科技联合上海交大 发布 AI智能体 SciMaster,个人的通用科研智能体助手,主要功能免费,基于科学模型 Innovator。 2025年7月26日,字节跳动 发布开源 扣子开发平台(Coze Studio)和扣子罗盘(Coze Loop),此前已开源Agent开发框架 Eino,覆盖Agent开发、评测、运维。 2025年7月26日,钛动科技 发布 AI智能体 Navos,全球营销AI Agent,在创意、投放、数据分析等营销全链路环节提供赋能,AO、AD、AS等一系列Agent智能体协作。 2025年7月26日,RockAI 发布 具身智能模型 Yan 2.0 Preview,参数3B,非Transformer架构,专为端侧离线智能设备设计,具备"原生记忆"能力,可边用边学。 2025年7月25日,字节跳动 发布 推荐算法模型 RankMixer-1B,为抖音数亿用户提供个性化信息流服务。 2025年7月25日,阶跃星辰 发布 通用语言模型 Step-3,参数321B,MoE架构,于7月31日开源。 2025年7月25日,后摩智能 发布 AI芯片 后摩漫界®M50,用于存算一体端边模型,功耗仅10W,带宽153.6 GB/s,最大48GB内存,物理算力160TOPS@INT8,浮点算力100TFLOPS@bFP16。推出力擎系列M.2卡、力谋系列加速卡、计算盒等硬件,覆盖移动终端与边缘场景。 2025年7月25日,阿里巴巴 发布开源 推理思考模型 Qwen3-235B-A22B-Thinking-2507,128k上下文,MoE架构,在推理、数学、科学和编码等任务表现提升。 2025年7月25日,清华大学联合生数科技 发布 具身智能模型 Vidar,机器人可通过普通视频来学会实际物理操作。 2025年7月24日,阿里巴巴 发布 语言模型 Qwen-MT,翻译专用,可通过Qwen API等方式使用。 2025年7月24日,GitHub 发布 AI编程工具 GitHub Spark,用自然语言把想法变成软件APP。早在2024.10.29,Spark发布预览开始内测。 2025年7月24日,北京大学联合智在无界(BeingBeyond) 发布 视觉语言动作(VLA)模型 Being-H0,基于人类视频手部数据训练,用于具身智能机器人手部运动。 2025年7月24日,TestSprite 发布 AI编程工具 TestSprite 2.0,可基于MCP协议在AI IDE(如Cursor或Trae)中使用的代码测试平台,或在其网页端测试代码,提升代码准确率。只需在AI IDE中提示:用TestSprite测试这个项目。有免费和付费版本。 2025年7月23日,LiblibAI 发布 AI智能体 Lovart,设计Agent,全链路自动化设计,模型协同创作,人机协作交互,推出 ChatCanvas 玩法。 2025年7月23日,阿里巴巴 发布开源 代码语言模型 Qwen3-Coder-480B-A35B-Instruct,256K上下文可扩展至1M,MoE架构,在通用、代码及Agent等能力表现提升。 2025年7月22日,零一万物 发布 AI智能体 万仔,超级员工,可调用内外部知识数据,跨部门组织串联各种工具实现结果交付,自主迭代进化。 2025年7月22日,星动纪元 发布 机器人 星动L7,全尺寸人形,55个自由度,身高171cm,基于端到端的视觉语言动作(VLA)模型ERA-42,双臂负重20kg,奔跑速度4m/s。 2025年7月22日,阿里巴巴 更新发布 Qwen3-235B-A22B-Instruct-2507-FP8,非思考模式(Non-Thinking)的更新,256K上下文,通用能力提升。 2025年7月18日,OpenAI 发布 通用型AI Agent:ChatGPT Agent。具备自主思考和行动的能力,能够主动从其技能库中选择合适的工具,完成各种复杂任务,结合Deep research多步研究和高质量报告生成能力、Operator通过远程可视化浏览器环境执行任务的能力等。 2025年7月14日,谷歌Google 发布 稳定版文本嵌入模型 gemini-embedding-001。 2025年7月11日,月之暗面(Moonshot AI) 发布 开源混合推理模型 Kimi K2,总参数1万亿,激活参数320亿。 2025年7月11日,清华大学联合生数科技 发布 音频模型 FreeAudio,可自然语言与时间提示实现精确时间控制与超过10秒的音频生成。 2025年7月10日,快手 发布 图像生成模型 可图2.1。 2025年7月10日,vivo 发布 端侧推理模型 BlueLM-2.5-3B,可直接理解GUI页面。 2025年7月9日,xAI 发布 通用语言模型 Grok-4。包含Grok 4,Grok 4 Heavy,编程模型Grok 4 Code。 2025年7月7日,腾讯混元 发布 3D生成模型 Hunyuan3D-PolyGen,能接入Maya、Blender等专业工具,可应用于UGC游戏资产生成。 2025年7月4日,北京智源人工智能研究院 发布 开源图像生成模型 OmniGen2。 2025年7月3日,LiblibAI 发布 AI智能体 星流Agent,Lovart的中文官方版,创意设计Agent。 2025年7月2日,智谱AI 发布 开源视觉推理思考模型 GLM-4.1V-9B-Thinking。 2025年7月2日,字节跳动 发布 开源图像生成模型 XVerse,基于Diffusion Transformer架构,能控制生成图像中每个主体,同时保持图像质量。 2025年7月1日,阿里巴巴 发布 开源泛语音生成模型 ThinkSound,首次将思维链(CoT)引入音频生成领域,有1.3B、724M、533M三种,用于视频配音。 2025年6月30日,百度 宣布 开源 文心4.5系列模型,开源包括10款模型,参数从0.3B到47B,同步提供API。 2025年6月30日,Meta的LeCun团队 发布 开源世界模型 PEVA,学会人类的“预判能力”,首次实现16秒连贯场景预测。 2025年6月30日,华为 发布 开源混合推理模型 盘古Pro MoE,总参数720亿,激活参数160亿。 2025年6月29日,俄亥俄州立大学研究团队 发布 开源生命视觉模型 BioCLIP 2,能识别95万生命物种,并自己悟出生态关系与个体差异。 2025年6月27日,阿里巴巴 发布开源 图像模型Qwen-VLo,支持图像生成和编辑;发布 信息检索Agent:WebDancer,输入指令可上网搜索、做攻略,自主信息检索代理和类深度研究模型的推理。 2025年6月27日,谷歌Google 发布 通用语言模型Gemma 3n,用于端侧,原生支持文本、图像和音视频等多种模态输入理解,有5B(E2B)和8B(E4B)两种。 2025年6月26日,小米 发布 小米AI眼镜,1999元起售。 2025年6月26日,Black Forest Labs 发布 开源图像编辑生成模型 FLUX.1 Kontext[dev],参数12B,专为图像编辑打造,可直接在消费级芯片上运行。 2025年6月26日,蚂蚁 发布 AI医疗健康应用 AQ,基于蚂蚁医疗模型,可模仿真人医生追问,引导用户提供信息,给出准确健康建议,支持图片+文字输入,可解读报告、药盒、病历等,健康档案可记录就医、用药、运动、饮食等信息。中医科等细分科室医生AI分身,减重专区,健康生活,就医医保等服务。 2025年6月26日,阿里巴巴 发布开源 推理AI模型 HumanOmniV2。 2025年6月26日,Sapient Intelligence 发布开源 推理思考AI模型 Hierarchical Reasoning Model(HRM),参数量27M(0.027B),模仿大脑的分层处理与多时间尺度运作机制,克服Transfomer计算局限。 2025年6月25日,阿里巴巴达摩院 联合 浙江省肿瘤医院 发布 视觉医疗模型 DAMO GRAPE,全球首个胃癌影像筛查AI模型。 2025年6月25日,谷歌DeepMind 发布 人类基因组模型 AlphaGenome,专注于人类基因组中占比98%的非编码区调控预测,解码这98%长期未被理解的"基因组暗物质",用于复杂疾病风险分析;发布 开源免费AI工具 Gemini CLI,将Gemini模型整合到开发人员的终端工作流中,搭载Gemini 2.5 Pro,支持100 万token上下文,开发者凭个人谷歌账户即可获取免费Gemini Code Assist使用许可证,免费用户每分钟可发起60次请求,每日限额1000次。发布 本地具身智能模型 Gemini Robotics On-Device,可完全在机器人本地离线运行的视觉-语言-动作(VLA)模型。 2025年6月24日,科大讯飞 发布 医疗模型 星火医疗 V2.5 国际版,推出升级后的讯飞晓医 APP 香港版。 2025年6月24日,谷歌Google 发布 图像生成模型 Imagen 4 Ultra 与 Standard 预览版。 2025年6月24日,微软 发布 端侧语言模型 Mu,参数3.3亿,大小约330M,内置于Windows 11系统中,用户可通过自然语言指令来操控电脑设置。 2025年6月20日,华为 发布 推理思考模型 盘古5.5,7180 亿参数 NLP MoE(256 专家),支持自适应快慢思考切换;发布 面向AI时代的操作系统 HarmonyOS 6。 2025年6月19日,智象未来 发布 AI创作工具 Vivago2.0(智小象AI),集图片、视频和播客生成于一体,Agent判断意图来修图或生图。 2025年6月19日,美团 联合 浙江大学发布 语音交互图形用户界面(GUI)智能体 GUIRoboTron-Speech,让用户通过简单的语音指令就能控制计算机。 2025年6月19日,MiniMax 发布 通用智能体 MiniMax Agent。具备编程能力;能处理长文本、视频、音频、图片等多种信息,内置图像、音频、视频生成能力;开放的MCP生态。 2025年6月18日,MiniMax 发布 视频生成模型 Hailuo 02,1080P视频的直接输出,具有时空一致性和物理逻辑性。 2025年6月17日,谷歌Google 发布 推理模型 Gemini 2.5 Flash、Flash-Lite。 2025年6月17日,MiniMax 发布 开源混合推理模型 MiniMax-M1。参数4560亿,支持100万上下文输入及最长8万token推理输出。 2025年6月17日,阿里巴巴 发布 开源混合推理模型 Qwen3 全系列 MLX 量化模型。可在移动端部署,覆盖4bit、6bit、8bit、BF16四种精度,共 32 款,支持苹果 MLX 框架全系列设备(从 iPhone 到 Mac Pro)。 2025年6月17日,阿里巴巴 联合 中科院自动化研究所万彦阳团队 发布 GUI智能体决策诊断模型 GUI-Critic-R1,能在GUI智能体操作执行前对其决策进行诊断,以避免不必要的操作和不可挽回的错误。 2025年6月17日,月之暗面(Moonshot AI) 发布 开源代码模型 Kimi-Dev,参数72B。 2025年6月15日,北京大学张牧涵团队 联合 亚马逊云 发布 以图为中心的关系型数据库(RDB)基础模型 Griffin。 2025年6月14日,港中文MMLab、港理工、北京大学等 联合发布 视觉理解模型 PAM(Perceive Anything Model),一次交互,「分割+识别+解释+描述」全搞定,同时支持图像、视频和长视频,文本&Mask同时输出。 2025年6月14日,腾讯 发布 开源3D生成模型 混元3D 2.1,首个实现全链路开源的工业级3D生成模型,已集成至腾讯游戏编辑器“轻游梦工坊”,道具管线制作周期从2天缩短至0.2天。 2025年6月12日,阿里巴巴的夸克 发布 高考志愿模型,首个专为中国高考志愿填报场景开发的AI模型,同步上线 “高考深度搜索”“志愿报告”“智能选志愿” 三大核心功能,为中国考生提供专业、精准的个性化志愿填报服务,可在夸克浏览器或手机夸克APP、夸克搜索网页版中使用。 2025年6月12日,谷歌Google的DeepMind 发布 气候预测模型 Weather Lab,推出实验性气旋预测功能,可提前15天生成多达50种可能的风暴情景,与美国国家飓风中心合作,支持飓风季预报和预警,已开源部分代码和数据集。 2025年6月11日,字节跳动 更新发布 推理思考AI模型 doubao-seed-1.6系列,包括doubao-seed-1.6、doubao-seed-1.6-thinking、doubao-seed-1.6-flash,多模态输入理解,图形界面操作能力,图像和复杂推理与数学能力提升。发布 视频生成模型 Seedance 1.0 pro,支持多场景视频内容创作。 2025年6月11日,Meta 发布 开源世界模型 V-JEPA 2,用视频数据训练,使机器人和AI Agent理解物理世界。发布 AI视频编辑功能,基于Movie Gen和Llama Image模型,允许用户用多个预设AI提示编辑短视频,改变服装、地点、风格等,可在Meta AI应用程序、Meta.AI网站和Edits应用程序中使用。 2025年6月10日,OpenAI 发布 多模态推理思考模型 o3-pro ,设计为“思考更久”以提供最可靠响应,擅长数学、科学、编码,可访问工具。API定价为每百万token输入20美元/输出80美元。宣布 o3 降价80%,比GPT4o还便宜。OpenAI CEO 山姆·奥特曼说: ChatGPT已经比历史上存在过的任何人都强大,人类已经跨过了一个温和的奇点。 2025年6月9日,小红书REDnote 发布 开源语言模型 dots.llm1,参数142B的混合专家模型(MoE),用大量非合成数据训练,推理中仅激活14B参数。 2025年6月6日,字节跳动 发布 图像编辑模型 SeedEdit 3.0,基于文生图模型Seedream 3.0,在图像主体保持、背景细节处理以及指令遵循等方面实现提升,将在 即梦 和 豆包 中上线。 2025年6月6日,Fish Audio 发布 开源文本转语音(TTS)模型 OpenAudio S1-Mini,参数0.5B,小参数自然AI语音,支持14种语言,能生成超50种情感和语调的语音表达。 2025年6月6日,阿里巴巴 发布 开源向量模型 Qwen3-Embedding 和 Qwen3-Reranker,专为文本表征、检索与排序任务设计,支持119种语言及编程语言,提升搜索相关性。 2025年6月6日,智源研究院 发布 多模态模型 悟界系列,其中:全球首个 原生多模态世界模型 Emu3,基于纯自回归的 “下一个token预测” ,统一文本、图像与视频的理解与生成,构建模态无关的统一表征空间,无需扩散模型与组合;全球首个 脑科学多模态通用基础模型见微 Brainμ,基于Emu3,将神经科学与脑医学相关的脑信号统一token化,实现多模态脑信号与文本、图像等模态的多向映射;全球首个 支持MCP的跨本体大小脑协作框架 悟界・RoboOS 2.0, 具身大脑模型 悟界・RoboBrain 2.0;全原子微观生命模型 OpenComplex2,微观模拟与建模。 2025年6月5日,ElevenLabs 发布 文本转语音模型 Eleven v3 Alpha版,通过引入音频标签实现对语音情感、语速的精准控制,支持70多种语言,并具备更强的文本理解和对话模拟能力。 2025年6月5日,Anthropic 发布 专为政府部门的AI模型套件 Claude Gov,专为美国国家安全机构量身定制,旨在满足政府层面,特别是情报和国防领域的严苛需求。已在部分高级别国家安全机构中部署使用。 2025年6月5日,谷歌Google的DeepMind 更新发布 多模态推理思考模型 Gemini 2.5 Pro preview(0605),100万token的上下文处理能力,思考有快速、深度、平衡和自适应调节模式,回答准确性与效果再提升。 2025年6月3日,昆仑万维 发布 开源推理思考模型 Skywork-MoE-Medium,总参数146B,激活参数22B,单台8×RTX 4090服务器可推理。 2025年6月3日,中国水科院 发布 水利标准AI模型,基于“SkyLIM”体系,用“知识库+DeepSeek/Qwen双模型+标准服务”架构,多模态数据融合,实现水利标准立项、制定、实施与监督全生命周期数字智能化管理。 2025年6月3日,谷歌Google的DeepMind 宣布 Gemini Live功能 已上线Apple的iOS和iPadOS,但目前仅限美国用户使用。 2025年5月29日,深度求索 发布更新 开源推理思考模型 DeepSeek-R1-0528,优化复杂推理与幻觉问题。 2025年5月22日,Anthropic 发布 多模态推理思考模型 Claude 4 Opus 和 Claude 4 Sonnet,具备7小时自主任务执行连续工作能力,可在扩展思考过程中使用外部工具,代码与推理能力提升。 2025年5月21日,谷歌Google的DeepMind 发布 开源端侧多模态模型 Gemma 3n,基于Gemini Nano,参数5B和8B,支持音频、文本、图片和视频等多种数据类型。音频上还可识别背景音及音频情感。设备端本地运行。更新发布 浏览器操作自动化Agent工具 Project Mariner,能运行多达十个并行任务流及 “教导与重复” 功能等。 2025年5月20日,谷歌Google的DeepMind 更新发布 多模态推理思考模型 Gemini 2.5 Pro, 提升代码生成、逻辑推理和多模态理解能力。 发布 Gemini Live API 预览版,视听输入和输出音频对话,情感感知并知何时回应,支持超过24种语言并可无缝切换,已在Gemini API中可用。发布 视频生成模型 Veo3,首次实现视频与音频的原生同步生成。更新发布 音频音乐生成模型 Lyria 2,适用于品牌配乐、影视音乐和数字内容制作。发布 图像生成模型 Imagen 4,生成的图像细节更逼真。发布 AI电影制作工具Flow。 2025年5月20日,字节跳动 发布 语音生成模型 豆包·语音播客模型,实现从文本创作到双人对话式播客的转化,支持长文本转播客,可在豆包PC端、扣子空间等产品中体验。 2025年5月15日,Meta 发布 开源通用原子模型 Universal Models for Atoms(UMA),包括UMA-small和UMA-medium,在分子特性预测、材料设计、触媒开发、能量存储及半导体制造等领域表现出色。开源化学数据集Open Molecules 2025(OMol25)。 2025年5月14日,OpenAI 发布 语言模型 GPT-4.1系列,专用于编码任务,更擅长指令遵循和Web开发。包括GPT-4.1、GPT-4.1 mini、GPT-4.1 nano。 2025年5月14日,谷歌Google的DeepMind 发布 编程AI Agent AlphaEvolve,专用于设计高级算法,与Gemini深度集成,能够自动评估通用算法的发现与优化,助力开发人员高效设计出优质、高效的矩阵算法。已协助解决 最早可追溯至1694年的 牛顿也曾参与辩论和研究的 数学难题"亲吻数问题"。 2025年5月6日,谷歌Google的DeepMind 更新发布 多模态推理思考模型 Gemini 2.5 Pro preview(0506),编码性能再提升,开发者体验提升。 2025年4月30日,Physical Intelligence(PI) 发布开源 具身智能模型 π₀.₅。视觉-语言-动作(VLA)模型,“感知→规划→执行”层次推理,引入动作专家子网。打破π₀模型的泛化瓶颈。 2025年4月30日,小米Xiaomi 发布 开源推理思考模型 MiMo,参数7B,在数学和编程测试表现良好。 2025年4月29日,阿里巴巴 发布 开源混合推理思考模型 Qwen3,支持119种语言,可调用工具提升任务处理能力,根据任务复杂度自动切换“快/慢思考”模式。包含2个MoE模型(Qwen3-235B-A22B、Qwen3-30B-A3B)和6个Dense模型(Qwen3-32B、Qwen3-14B、Qwen3-8B、Qwen3-4B、Qwen3-1.7B、Qwen3-0.6B)。 2025年4月29日,Meta 发布 应用 Meta AI App,基于Llama 4,个性化AI助手,支持语音对话、图像编辑,跨Meta应用和眼镜使用。 2025年4月27日,阶跃星辰 发布 开源通用图像编辑模型 Step1X-Edit,参数19B,提供人人可用的多模态改图能力,可完成日常工作和生活中的高频11类图像编辑任务。 2025年4月26日, 月之暗面(Moonshot AI)发布开源语音模型Kimi-Audio,基于Qwen2.5-7B,融合Whisper技术,支持语音识别、音频理解、音频转文本、语音对话等多种任务。 2025年4月26日,鱼跃医疗发布鱼跃医疗模型和AI agent健康管家,开启全面公测。 2025年4月25日,谷歌Google的DeepMind 发布 音乐生成模型 Lyria2,可生成多风格高保真音频;推出基于Lyria2的Lyria RealTime功能,支持实时音乐创作。升级Music AI Sandbox,向更多美国的音乐家、制作人和词曲创作者开放。推出SynthID水印技术,在生成的音频中嵌入不可察觉的数字水印,以确保AI生成内容的可识别性,防止潜在的版权争议。 2025年4月25日,OpenAI发布轻量版DeepResearch,基于o4-mini, 面向免费用户,回答更短,但智能水平与全量版相当。 2025年4月25日,百度发布多模态模型 文心4.5 Turbo 和 推理思考模型 X1 Turbo,推出高说服力数字人、通用智能体APP “心响”,开放电商交易 MCP 服务器,推出内容操作系统“沧舟OS”。发布 多模态AI编程智能体 文心快码Comate Zulu,自动生成代码并支持多种开发环境,降低编程门槛。 2025年4月24日,中科创达 发布 多模态操作系统 滴水OS 1.0 Evo,面向智能汽车的AI原生操作系统,支持舱驾融合与算力调度,提升交互与驾驶体验。 2025年4月24日,OpenAI发布图像生成模型GPT-image-1的API,即驱动GPT-4o多模态图像生成能力的模型,高质量专业级图像生成。 2025年4月24日,Adobe 发布图像生成模型Firefly Image Model 4 和 Firefly Image Model 4 Ultra,支持Photoshop/Illustrator 插件集成,并引入 “协作模式” 。 2025年4月22日,欧洲航天局与IBM联合推出地球观测多模态模型TerraMind,整合卫星图像、地形数据等多模态信息,用于监测甲烷泄漏、森林变化等环境问题。 2025年4月21日,昆仑万维SkyReels团队 发布 开源视频生成模型 SkyReels-V2,可用扩散强迫框架(Diffusion-forcing)生成无限时长电影,为普通人创作视频提供新选择。 2025年4月21日,Sand AI(三呆科技)发布开源视频生成模型 MAGI-1,全球首个自回归视频生成模型,支持 “无限续写” 与秒级精准控制,由Swin Transformer团队研发。 2025年4月21日,生数科技发布视频生成模型 Vidu Q1,支持5秒1080P视频生成,可用文本生成相关音效。 2025年4月19日,北京体育局、中央广播电视总台等多机构 联合在北京举办 人形机器人半程马拉松比赛。要求全尺寸人形机器人以双足行走方式完成标准半马距离赛跑,核心考验机器人的关节耐久性、 电池续航与热管理 、复杂地形适应、人机协同等,由20支人形机器人团队参赛,天工Ultra获冠。 2025年4月17日,谷歌 发布原生多模态混合推理模型 Gemini 2.5 Flash,可自由设定思考深度。 2025年4月17日,字节跳动发布语言推理思考模型Doubao-1.5-thinking-pro 和 多模态视觉推理思考模型Doubao-1.5-thinking-pro-vision。 2025年4月17日,微软发布推理思考模型 BitNet b1.58 2B4T,采用三值量化技术(仅-1/0/1),内存占用压缩至传统模型的1/8,推理速度提升5倍,可在普通CPU运行。 2025年4月16日,OpenAI发布推理思考模型o3和o4-mini,开源Codex CLI。o3具备图像深度推理能力,编程和数学能力提升;o4-mini成本降低40%,支持高频推理场景。Codex CLI是可在终端运行的轻量编程智能体,可在个人电脑运行。 2025年4月15日,字节跳动发布图像生成模型Seedream3.0,支持2K分辨率直出、中文文本渲染优化。 2025年4月15日,快手发布多模态视频生成模型可灵2.0 和 图像生成模型可图 2.0。可灵2.0支持文字图片视频混合编辑,实现多模态内容融合生成。可图2.0提升准确性,支持2K分辨率直出。 ​2025年4月15日,OpenAI发布多模态模型GPT-4.1系列​​,包括GPT-4.1、GPT-4.1 Mini、GPT-4.1 Nano。这些模型专为API开发者设计。GPT-4.1支持100万token上下文,可处理大型代码库;Nano版成本低,每百万token输入0.1美元。GPT-4.5将逐步淘汰。 2025年4月14日,字节跳动发布推理思考模型Seed-Thinking-1.5,基于MoE架构(200B),在数学推理和编程任务中性能接近OpenAI o3-mini,延迟低至20毫秒,推理成本降低。于4月17日通过火山引擎开放接口供用户体验。上线视频生成模型Seaweed-7B。 2025年4月14日,谷歌Google的DeepMind发布生物声学模型 DolphinGemma,基于 400M 参数轻量架构,可解析大西洋斑点海豚的声音 “语言”,支持手机端实时分析,助力生态保护与生物智能研究。 2025年4月13日,昆仑万维 发布开源推理思考模型 Skywork-OR1系列,包含Skywork-OR1-Math-7B,Skywork-OR1-7B-Preview,Skywork-OR1-32B-Preview。 2025年4月11日,华为盘古发布通用语言模型Pangu Ultra,135B参数,基于全中国国产昇腾芯片研发。 2025年4月11日,傅利叶智能 发布开源 双足人形机器人 Fourier N1。23个自由度,高1.3m,重38kg,单次续航大于2小时,复现成本约5–8万元。完全开源的人形机器人,开放全部软硬件资源,提供可复现、可拓展的研发基础,降低机器人开发门槛。2025年10月19日在IROS 2025国际大会上首次公开展示。 2025年4月10日, 月之暗面(Moonshot AI)发布开源 视觉语言模型Kimi-VL 和 视觉语言推理思考模型Kimi-VL-Thinking,都基于MoE架构,16B参数。 2025年4月10日,商汤科技 发布 通用语言模型 日日新SenseNova V6,支持64K思维链、视频推理及全局记忆功能。发布 AI平台 商汤装置SenseCore 2.0,拥抱开源,训推一体,异构算力调度与国产芯片适配,支持具身智能与AIGC场景。 2025年4月9日, 谷歌Google 推出开源AI通信协议A2A(Agent2Agent Protocol),能让AI Agent在不同生态系统间安全协作,无需考虑框架或供应商。谷歌Google称A2A是对MCP的补充。 2025年4月9日,亚马逊Amazon 发布语音模型 Amazon Nova Sonic,自然对话能力,低延迟与高性价比,支持双向流式 API,已集成到 Alexa+语音助手,并向开发者开放测试。 2025年4月8日,谷歌Google 更新发布 Gemini Deep Research功能,将Gemini Advanced的Deep Research功能模型升级到Gemini 2.5 Pro,免费用户的Deep Research功能模型是Gemini 2.5 Flash。 2025年4月4日,谷歌Google 发布 网络安全模型 Sec-Gemini v1,专注于提升网络安全防御能力,对抗网络威胁,帮助快速准确评估潜在风险,制定应对策略,将免费开放给选定的组织、机构、专业人士和非政府组织(NGO)用于研究目的,以促进网络安全领域的合作与研究。 2025年4月2日,英国埃克塞特大学初旭副教授团队与北京航空航天大学王文康副教授团队联合发布流体力学语言模型OpenFOAMGPT,基于DeepSeek V3(671B)和Qwen 2.5-Max。 2025年4月1日,Meta发布开源原生多模态模型Llama 4系列,包括Scout(17B)、Maverick(400B)、Behemoth(2万亿)。混合专家(MoE)架构,支持1000万token上下文窗口。 2025年4月1日,Runway 发布视频生成模型 Gen-4。 2025年4月1日,百度 发布原生多模态模型 文心4.5 和 推理思考与工具调用模型 X1。 2025年3月31日,智谱清言 发布Agent智能体 AutoGLM“沉思”,具备自我反思能力,可执行网页操作与报告生成。 2025年3月29日,智源研究院 发布 跨本体具身大小脑协作框架 RoboOS 和 开源具身大脑模型 RoboBrain,可实现跨场景多任务轻量化快速部署与跨本体协作,推动单机智能迈向群体智能。 2025年3月28日,阿里巴巴 发布开源 视觉推理思考模型 通义QVQ-Max,基于QVQ-72B-Preview的优化升级版。 2025年3月28日,VAST 发布开源 3D生成模型 TripoSG和TripoSF。TripoSG 是基础3D生成,TripoSF 是专注于高分辨率三维重建和生成任务。 2025年3月27日,阿里巴巴 发布开源 端到端全模态模型 通义Qwen2.5-Omni-7B,支持文本、图像、音频、视频输入及实时语音合成输出,采用Thinker-Talker架构。 2025年3月27日,OpenAI 宣布其Agent SDK开始支持MCP(Model Context Protocol)。 2025年3月26日,OpenAI 发布多模态模型GPT-4o升级版,新增支持原生图像生成功能并免费使用,效果惊艳。 2025年3月26日,港科大(广州)与趣丸科技 合作推出 3D生成模型 Kiss3DGen,把传统3D生成问题转化为2D图像生成任务。 2025年3月26日,清华大学联合腾讯 发布开源 视频生成模型 Video-T1,将Test-Time Scaling引入视频生成领域。 2025年3月26日,昆仑万维 发布音乐推理模型 Mureka O1,支持旋律优化与音色克隆。 2025年3月25日,谷歌Google 发布原生多模态模型 Gemini 2.5 Pro Experimental,并于3月30日宣布免费开放使用。 2025年3月25日,阿里巴巴 发布开源 视觉语言模型 通义Qwen2.5-VL-32B-Instruct。 2025年3月25日,深势科技及北京科学智能研究院与北京大学 联合发布开源 3D生成模型 Uni-3DAR,通过自回归下一token预测任务将3D结构的生成与理解统一起来。 2025年3月25日,Keep 发布 运动健康多模态模型 Kinetic,推出AI智能体 AI教练卡卡(Kaka),动作示范指导,个性化训练计划生成、语音导练、饮食记录分析等。 2025年3月24日,深度求索 发布开源 语言模型 DeepSeek-V3-0324,是DeepSeek-V3的升级版。 2025年3月21日,上海财经大学联合财跃星辰等 发布 金融推理模型 Fin-R1-7B,基于Qwen2.5-7B-Instruct模型,金融领域效果接近DeepSeek-R1-671B。 2025年3月21日,腾讯混元 发布推理思考模型 T1正式版,基于Hybrid-Mamba-Transformer架构。 2025年3月21日,OpenAI发布语音模型API,包括 语音识别模型GPT-40 Transcribe、语音合成模型GPT-40 mini TTS,两个语音模型已整合进Agent SDK。 2025年3月20日,OpenAI推出o1-pro API,当时最贵AI模型,输入价格150美元/百万token,输出价格约600美元/百万token。 2025年3月20日,老板电器 宣布烹饪模型“食神”接入DeepSeek推理能力,拓展多模态能力。 2025年3月20日,Hugging Face推出AI助手HuggingSnap,本地化AI视觉助手,基于轻量多模态模型smolVLM2,无需依赖云端服务器,确保隐私安全。 2025年3月18日,英伟达Nvidia发布开源推理模型Llama Nemotron,基于Llama;发布开源人形机器人推理和技能模型GR00T N1;更新开源视频世界基础模型Cosmos系列,包括Cosmos-Reason1-8B和Cosmos-Reason1-56B。 2025年3月18日,Roblox 发布开源 3D生成模型Cube。 2025年3月15日,Sesame开源语音模型CSM-1B(Conversational Speech Model),语音助手Maya背后的基础模型。 2025年3月13日,Google发布Gemini机器人大脑模型Gemini Robotics。 2025年3月12日,Google发布开源非推理模型Gemma3;推出Gemini Flash 2.0原生多模态功能,模型直出图像,文修图。 2025年3月11日,OpenAI推出Agents SDK,帮助开发者更轻松地构建AI智能体。推出Responses API并已整合进Agents SDK。 2025年3月11日,阿里巴巴 发布开源全模态情感模型 R1-Omni。 2025年3月11日,智元机器人 发布多模态交互模型 硅光动语,用于具身智能机器人。 2025年3月10日,智元机器人 发布通用具身基座模型“启元”GO-1,一脑多形,用于具身智能机器人。 2025年3月6日,阿里巴巴 发布推理思考模型 通义QwQ-32B,基于Qwen2.5-32B强化学习而成。 2025年3月5日,BUTTERFLY EFFECT(蝴蝶效应) 发布 通用AI-Agent(自主智能体)产品 Manus,开启部分内测。 2025年2月24日-28日,深度求索DeepSeek 开源周开源五个代码库,分别是 FlashMLA、DeepEP、DeepGEMM、DualPipe、3FS。 2025年2月27日,OpenAI 发布GPT-4.5,代号 Orion 猎户座,OpenAI的最后一个非思维链模型,模型参数规模更大。 2025年2月25日,谷歌Google的DeepMind全球推出免费版Gemini Code Assist,基于Gemini 2.0,支持所有公共领域的编程语言,12.8万token上下文窗口。 2025年2月25日,Anthropic 发布 混合推理模型 Claude 3.7 Sonnet,支持标准模式(即时响应)与推理思考模式(分步推理),统一推理能力,兼顾效率与深度。发布基于该模型优化的代码开发Agent工具Claude Code。 2025年2月25日,阿里巴巴 发布基于 通义Qwen2.5-Max 的推理思考模型 通义QwQ-Max-Preview。 2025年2月25日,阿里巴巴 发布视频生成模型 通义万相 Wan 2.1 并开源,采用 Apache2.0 协议。 2025年2月18日,腾讯元宝上线腾讯混元推理思考模型 Thinker,即 T1。 2025年2月17日,xAI 推出多模态推理思考模型 Grok 3。 2025年2月5日,谷歌Google宣布 Gemini 2.0 向所有用户开放使用,包括 2.0 Flash、Pro Experimental 和 Flash-Lite 。 2025年1月31日,OpenAI 推出推理思考模型 o3-mini。 2025年1月29日,阿里巴巴 发布语言模型 通义Qwen2.5-Max。 2025年1月28日,OpenAI 发布 专为美国政府机构设计的 ChatGPT Gov,旨在提供比ChatGPT企业版更高层次的安全性,为政府人员和决策者提供定制化AI工具,协助其进行数据分析、信息管理、政策咨询,文件处理与政策起草,跨部门协作,日常行政事务等工作。 2025年1月23日,OpenAI发布AI智能体Operator,支持GUI交互,基于推理思考模型o3微调而成。 2025年1月20日,摩尔线程 发布 AI基础硬件 MTT S5000,数据中心算力GPU,第三代MUSA架构,支持FP8加速,千卡集群浮点算力10Exa-FLOPS,用MUSIFY工具兼容CUDA生态。 2025年1月20日,深度求索 发布推理思考模型DeepSeek R1,基于DeepSeek V3强化学习而成。 2025年1月20日,月之暗面(Moonshot AI)公布多模态思考模型 Kimi k1.5。在数学、代码、多模态推理能力等方面都接近OpenAI满血版o1。 2025年1月20日,字节跳动的豆包AI宣布全新端到端实时语音通话功能正式上线app。对话效果接近GPT4o实时语音。 2025年1月17日,Sakana推出自适应模型Transformer square,引入自适应机制,提高语言模型在未见任务上的泛化和自适应能力。 2025年1月16日,Luma发布视频模型Ray 2。 2025年1月16日,面壁智能发布 端侧全模态模型 MiniCPM-o 2.6 8B,效果接近GPT-4o。 2025年1月15日,Google发布人脑记忆模型Titian,引入神经长期记忆模块,能在测试时学习记忆。 2025年1月15日,讯飞星火发布推理思考模型讯飞星火 X1 和 星火语音同传模型。讯飞星火4.0 Turbo模型再升级。 2025年1月15日,生数科技发布上线视频生成模型Vidu 2.0,生成价格更低、速度更快、质量更稳。 2025年1月15日,MiniMax(海螺AI)开源MiniMax-01系列,支持4M上下文,包含两个:基础语言模型MiniMax-Text-01、视觉多模态模型MiniMax-VL-01。 2025年1月13日,潞晨发布视频生成模型Video Ocean V2.0,免费使用。 2025年1月11日,NovaSky发布Sky-T1-32B-Preview,训练成本不到450美元,具备高级推理能力。 2025年1月11日,谷歌Google开源能预知未来的时间序列模型TimesFM2.0。可预测股价走势、市场销量等。 2025年1月9日,Adobe推出视频模型TransPixar。 2025年1月7日,英伟达发布视频世界基础模型Cosmos。 2025年1月6日,昆仑万维宣布推理思考模型天工4.0 O1版(Skywork O1)全量上线,用户可免费使用。 2024年12月31日,智谱清言发布推理思考模型GLM-Zero-Preview。 2024年12月26日,深度求索 发布开源模型DeepSeek-V3,671B参数,MoE架构。 2024年12月25日,阿里巴巴 发布视觉推理思考模型 通义QVQ-72B-Preview。 2024年12月23日,Answer.AI和英伟达等联合发布ModernBERT。基础版139M,较大版395M。 2024年12月23日,百川发布金融领域增强模型Baichuan4-Finance。 2024年12月21日,OpenAI发布思考推理模型o3和o3-mini。 2024年12月20日,谷歌Google发布推理思考模型Gemini 2.0 Flash Thinking。 2024年12月19日,字节跳动发布视觉模型Doubao-vision-pro-32k。还有豆包·音乐模型,豆包·文生图模型。 2024年12月19日,腾讯发布混元视频模型FastHunyuan。 2024年12月19日,学术界和产业界共20多个组织联合研究发布 生成式物理引擎Genesis,一句话就可以生成完整精确的模拟物理世界。 2024年12月17日,谷歌Google发布视频生成模型Veo 2。 2024年12月16日,月之暗面(Moonshot AI)发布视觉思考模型Kimi-k1。 2024年12月16日,无问芯穹宣布首个端侧全模态理解的开源模型Megrez-3B-Omni。 2024年12月13日,巨人网络发布有声游戏生成模型 千影QianYing,包括游戏视频生成模型YingGame、视频配音模型YingSound。 2024年12月13日,微软发布14B小模型Phi-4。 2024年12月11日,谷歌Google的DeepMind发布Gemini 2.0,面向智能体时代的AI模型。发布 基于Gemini 2.0的三个AI Agent,通用AI助手Project Astra,浏览器自动操作工具 Project Mariner,编程助手Jules。 2024年12月10日,智源研究院推出3D生成模型See3D。 2024年12月10日,OpenAI视频生成模型Sora开放付费用户使用。 2024年12月9日,xAI上线文书图模型Aurora。 2024年12月9日,北京交通大学研究团队推出O1-CODER,专注于编码任务。所有源代码/精选数据集及衍生模型都开源。 2024年12月7日,Meta发布Llama-3.3-70B。 2024年12月7日,MinMax海螺AI发布2D动画专用视频生成模型Hailuo I2V-01-Live,日漫迪士尼插画风都支持。 2024年12月6日,OpenAI上线推理思考模型o1和o1-Pro。 2024年12月5日,谷歌Google的DeepMind推出生成式3D游戏引擎Genie 2,可响应键鼠操作,可玩、可控制,一张图生成无限多样的3D游戏世界。 2024年12月5日,中国电信人工智能研究院(TeleAI)发布视频模型 TeleAI-VAST。 2024年12月4日,亚马逊发布多模态模型Amazon Nova系列,共六款,涵盖文本对话、图片生成、视频生成。 2024年12月4日,阿里巴巴的通义实验室推出自适应规划的多模态检索智能体OmniSearch,能模拟人类解决问题的思维方式,将复杂问题逐步拆解智能检索规划。 2024年12月3日,腾讯发布并开源混元视频生成模型HunyuanVideo,130亿参数。 2024年11月28日,阿里巴巴上线推理思考模型 通义QwQ-32B-Preview。 2024年11月28日,上海AI实验室上线推理思考模型InternThinker。 2024年11月27日,昆仑万维发布推理思考模型天工4.0 O1版,即Skywork O1。 2024年11月26日,华盛顿大学和艾伦人工智能研究所(Ai2)共同推出科研助手开源模型Ai2 OpenScholar-8B,论文检索增强生成回答,从论文到数据集、模型检查点都开源。 2024年11月21日,阶跃星辰发布万亿参数模型Step-2-16k-202411。 2024年11月21日,深度求索 发布上线推理思考模型DeepSeek-R1-Lite。 2024年11月19日,Mistral AI发布多模态大模型Pixtral Large,124B参数量。 2024年11月19日,阿里巴巴 发布 通义Qwen2.5-Turbo。 2024年11月19日,北大等推出首个多模态推理思考开源模型LLaVA-o1,基于Llama-3.2-Vision模型打造,实现自主“慢思考”推理。 2024年11月16日,月之暗面(Moonshot AI)发布数学模型k0-math。 2024年11月14日,生数科技发布视频生成模型Vidu,能实现多主体一致性。 2024年11月12日,小米发布语言模型MiLM2系列。 2024年11月12日,阿里巴巴 发布编程模型 通义Qwen2.5-Coder-32B。 2024年11月11日,谷歌DeepMind 开源 生物分子结构预测模型AlphaFold3,能预测 所有生物分子 的三维结构及其相互作用,获诺奖。 2024年11月9日,香港生成式人工智能研发中心(HKGAI)旗下AI for Reasoning团队(HKAIR)联合北京大学对齐团队(PKU-Alignment Team)推出全球首个法律推理思考模型HK-O1aw。 2024年11月6日,百图生科发布生命科学基础模型xTrimo V3,2100亿参数,覆盖蛋白质、DNA、RNA、细胞等七大主流模态。 2024年11月6日,阿里巴巴的达摩院发布气象模型“八观”,预测时空精度最高可达1公里×1公里×1小时。 2024年11月6日,腾讯发布开源MoE模型Hunyuan-Large,3890亿总参数,520亿激活参数。 2024年11月5日,腾讯发布3D生成模型Hunyuan3D-1.0。 2024年11月5日,上海AI Lab团队发布推理思考模型LLaMA-O1。上交大团队发布推理思考模型O1-Journey。 2024年10月25日,智谱清言发布视觉语言模型CogAgent,专用理解和导航GUI。基于此模型基座的应用AutoGLM、AutoGLM-Web、GLM-PC。 2024年10月25日,上海AI Lab团队宣布原生多模态模型Mono-InternVL。 2024年10月24日,讯飞星火发布模型 星火4.0 Turbo。 2024年10月22日,Anthropic发布Computer Use功能,基于Claude 3.5系列模型。 2024年10月21日,智源研究院 发布 原生多模态世界模型 Emu3,基于下一个token预测,无需扩散模型或组合方法,即可完成文本、图像、视频三种模态数据的理解和生成。 2024年10月16日,零一万物发布模型Yi-Lightning。 2024年10月6日,Black Forest Labs(黑森林实验室)发布文生图模型Flux1.1。 2024年10月4日,Meta发布视频生成模型Meta Movie Gen。 2024年10月1日,中国电信人工智能研究院TeleAI开源千亿参数模型 星辰语义TeleChat2-115B。 2024年9月26日,Meta发布多模态模型Llama 3.2。 2024年9月20日,VAST发布3D生成模型Tripo 2.0。 2024年9月20日,快手发布上线视频生成模型 可灵1.5。 2024年9月19日,阿里巴巴 发布开源模型 通义Qwen2.5系列。 2024年9月14日,元象XVERSE发布MoE开源模型 XVERSE-MoE-A36B,总参数255B,激活参数36B。 2024年9月13日,OpenAI发布推理思考模型o1系列,其中o1-mini和o1-Preview已上线。 2024年9月12日,Mistral发布多模态开源模型Pixtral 12B。 2024年9月8日,Replit推出编程智能体Replit Agent。开发环境/编写代码/安装软件包/配置数据库/部署等,都自动化。 2024年9月6日,OthersideAI发布开源模型Reflection系列。 2024年8月30日,阿里巴巴 发布开源多模态模型 通义Qwen2-VL。 2024年8月18日,智元机器人 发布 双足人形机器人 远征A2、灵犀X2。 2024年8月14日,xAI发布多模态模型Grok-2。 2024年7月24日,Mate发布开源模型LIama 3.1。 2024年7月19日,OpenAI推出模型GPT4o mini。 2024年6月27日,讯飞星火发布星火4.0。 2024年6月24日,老板电器 发布烹饪模型“食神”。 2024年6月21日,Anthropic发布模型Claude3.5 Sonnet。 2024年5月15日,谷歌 发布 AI软件功能 AI Overviews,原名Search Generative Experience(SGE)。基于Gemini模型作为Google搜索的核心功能,用于增强搜索整理各种网络信息。 2024年5月14日,OpenAI发布GPT-4o(Omini)。 2024年5月13日,宇树科技 发布开源 人形机器人 宇树G1,起售9.9万元 。 2024年5月8日,谷歌DeepMind与Isomorphic Labs 联合发布 生物分子结构预测模型 AlphaFold3。可高精度预测蛋白质、DNA、RNA、配体及离子等生物分子的三维结构及其相互作用,无需实验输入即可完成复合物建模,显著提升药物设计与基础生物学研究效率。上线非商业网页AlphaFold Server。 2024年4月10日,OpenAI发布GPT-4 Turbo with Vision版本,即GPT-4V。 2024年3月17日,xAI发布Grok-1。 2024年3月4日,Anthropic发布上线多模态模型Claude 3系列。 2024年2月16日,Meta 发布 开源世界模型 V-JEPA(Video Joint Embedding Predictive Architecture),通过视频数据理解物理世界的动态关系。 2024年1月16日,智谱清言发布多模态模型GLM4.0。 2024年1月16日,MinMax发布MoE语言模型abab6。 2023年12月19日,摩尔线程 发布 AI基础硬件 MTT S4000,AI算力加速卡,面向模型训练推理。显存48GB-GDDR6,显存带宽768GB/s,FP16算力100TFLOPS,INT8算力200TOPS,自研MTLink1.0多卡互联240GB/s。 2023年12月6日,谷歌Google的DeepMind发布Gemini 1.0,原生多模态架构。 2023年11月28日,智元机器人 发布 轮式人形机器人 精灵G1。 2023年11月16日,微软将BingChat(NewBing)全线更名新品牌为Copilot,拥有专属网站,其GPT-4及Dall·E 3等功能用户可免费使用。 2023年10月17日,百度发布多模态模型 文心一言4.0。 2023年9月25日,OpenAI发布ChatGPT Voice,可与用户实时对话交流,语气流畅自然十分逼近真人,拍照对图片进行问答交互。 2023年9月21日,OpenAI发布DALL·E3。 2023年9月19日,谷歌DeepMind 发布 人类基因组模型 AlphaMissense。 基于AlphaFold2架构扩展,可对人类基因组中7100万种错义突变的致病性进行评分,覆盖大部分编码区功能变异,助力罕见病诊断。已开源部分内容。 2023年8月18日,智元机器人 发布 双足人形机器人 远征A1、灵犀X1。 2023年7月18日,Meta发布开源模型Llama 2.0。 2023年7月11日,Anthropic发布Claude 2.0。 2023年03月17日,微软宣布Microsoff 365 Copilot,将GPT-4全面接入微软Office全家桶。 2023年3月15日,Anthropic发布Claude 1.0。 2023年03月15日,OpenAI发布多模态模型GPT-4。 2023年2月25日,Meta发布开源模型Llama 1.0。 2023年02月08日,微软上线基于GPT-4的NewBing搜索引擎和Edge浏览器,支持Dall·E文生图。 2022年11月30日,OpenAI通过GPT-3微调得到GPT-3.5,全新对话式AI应用ChatGPT正式发布,用户免费使用。 2022年04月06日,OpenAI发布DALL·E2。 2021年08月10日,OpenAI发布Codex模型,基于GPT3,即Github Coplilot背后的模型。 2021年7月15日,谷歌DeepMind 发布开源 蛋白质结构预测模型 AlphaFold 2,并联合欧洲生物信息研究所(EMBL-EBI) 发布 AlphaFold Protein Structure Database。实现原子级大规模蛋白质结构预测,覆盖人类及20种模式生物的全部蛋白质组。 2021年01月05日,OpenAI发布DALL·E模型,基于GPT3。 2019年06月10日,OpenAI发布GPT-3模型,1750亿参数。 2018年12月2日,谷歌DeepMind 发布 蛋白质结构预测模型 AlphaFold 1。通过多序列比对与残基距离预测,显著超越传统方法,证明深度学习可解决蛋白质折叠问题。在第13届蛋白质结构预测关键评估(CASP13)闭幕会议上首次公开亮相并夺冠。 2018年11月,OpenAI发布GPT-2模型,15亿参数,不向公众开放源码。 2018年10月,谷歌Google发布BERT模型。 2018年06月,OpenAI发布GPT-1模型,1.1亿参数。 欢迎评论区补充遗漏的发布事件,本文持续不定时更新中…… https:// docs.qq.com/smartsheet/ DUXVObEpMaW5qelB2
📥 下载地址(文章结尾)
装机神器,一键装机,安装任何系统。纯净版,原版,软件版,精简版,英文版。