Benchmark 榜单
2026-09-03
LMArena 改名 Arena,域名迁到 arena.ai
lmarena.ai/leaderboard 现在 301 跳转到 arena.ai/leaderboard,页面标题也已改成「Arena Leaderboard」。品牌名和域名都换了,旧链接暂时还能用(跳转),后续引用建议直接用新域名。
厂商 Blog
2026-09-03
开源Qwen-Drive-1.0自动驾驶视觉语言基础模型
面向自动驾驶场景的视觉语言基础模型,开源发布。
独立研究机构
2026-09-03
智谱与MiniMax中报对比:大模型商业化走向分层
智谱上半年API收入占比升至86.5%(去年同期15.2%),自称算力乘数同比提升约14倍,押注按调用量/任务付费;MiniMax海外收入占60.8%,走降本换量路线,ToB占ARR比例从约30%升至约80%——两条商业化路径开始明显分岔。
License / 条款变化
2026-09-03
DeepSeek 模型权重许可证从自定义 RAIL 式改成纯 MIT
V3(2024-12)权重单独适用类RAIL式自定义DEEPSEEK LICENSE AGREEMENT;R1(2025-01)起改为纯MIT,官方原话"Distill & commercialize freely",V3.1/V3.2-Exp延续至今,未再变化。
License / 条款变化
2026-09-03
Qwen 许可证从分层限权统一改为 Apache 2.0
Qwen2.5(2024-09)按体量分三档:中小模型Apache2.0、3B仅限非商用研究许可、72B旗舰版月活超1亿须向阿里云申请许可;Qwen3(2025-04)起不论尺寸统一改为Apache 2.0,含235B-A22B旗舰MoE。
License / 条款变化
2026-09-03
智谱 GLM 取消强制商业登记,LICENSE文件改为Apache 2.0(README仍标注MIT)
GLM-4-9B(2024-06)要求所有商业使用不论规模先在智谱开放平台登记;GLM-4.5起(2025-07)LICENSE文件已是完整Apache 2.0全文,登记/命名要求取消,但同仓库README仍写"MIT license",两者内容不一致,以LICENSE原文为准。
License / 条款变化
2026-09-03
Gemma 4 许可证改为纯 Apache 2.0,Gemma 1-3 仍受限
Gemma 1-3沿用带禁止用途政策和再分发义务的限制性"Gemma使用条款";2026年发布的Gemma 4改用纯Apache 2.0协议,但不追溯放宽,Gemma 1-3仍受旧条款约束。
License / 条款变化
2026-09-03
Llama 4 砍掉反竞争训练禁令,700M MAU门槛保留
Llama 3(2024-04)明确禁止用Llama材料或输出改进任何其他大语言模型;Llama 4(2025-04)许可证里这条反竞争禁令完全消失,改为温和的命名义务(训练出的模型须以'Llama'开头命名)。700M月活商业许可门槛本身未变,只是重新锚定到Llama 4发布日期。
License / 条款变化
2026-09-03
Grok-2 反向新增 Llama式反竞争条款,且签约主体变更为 SpaceXAI LLC
Grok-1曾是纯Apache 2.0;Grok-2的xAI Community License Agreement(2025-11-04更新)新增"不得用材料/输出训练改进任何基础模型"的反竞争条款,外加$100责任上限。另外,2026-09-01生效的最新消费者ToS里,签约主体已写成SpaceXAI LLC,注册地址与SpaceX德州总部一致,不再是独立的xAI Corp。
License / 条款变化
2026-09-03
Kimi K2 系列以 Modified MIT 持续开源,比 Qwen/Llama 门槛更轻
K2系列自2025年7月起持续开源(K2→K2.5→K2.7),Modified MIT License:月活超1亿或月收入超2000万美元时,唯一义务是产品界面显著展示模型名称,不需要像Qwen2.5旧版那样另外申请许可。两年间条款结构未变,只替换模型名。
License / 条款变化
2026-09-03
Mistral 商业条款静默收紧:放宽输出限制,收紧自身责任敞口
2025-12版商业条款禁止把网页搜索输出用于任何机器学习活动,2026-03版把这条整体删掉只留窄范围的图像训练限制;2026-05到08月间,原本为保密违约单独设的责任上限豁免被取消(现纳入标准12个月费用上限),Labs/Preview模型的零数据保留豁免也被拿掉。
License / 条款变化
2026-09-03
Anthropic 发布首份专门的开源权重政策立场文章
2026-07-27发布,原话"Anthropic has never advocated for a ban on open-weights models"——明确不主张禁止开源权重模型,转而提议用芯片出口管制、反蒸馏措施、强制安全测试来管理开源和闭源模型共同的风险。是覆盖期内厂商方面唯一一份专门针对开源权重监管立场的公开文件。
License / 条款变化
2026-09-03
OpenAI 唯一开源权重发布 gpt-oss 采用 Apache 2.0
gpt-oss-120b/20b权重许可证为纯Apache 2.0,另有一份独立的gpt-oss使用政策(非许可证条款)。这是OpenAI迄今唯一的开源权重发布,未发现更晚近的开源模型。
License / 条款变化
2026-09-03
字节跳动以独立品牌 Seed-OSS 开源模型,与"豆包"品牌分离
"豆包"品牌本身未发现开源权重发布;字节跳动Seed团队以独立品牌Seed-OSS发布开源模型(2025-08,Seed-OSS-36B),Apache 2.0许可证,GitHub仓库元数据和Hugging Face模型卡均确认。未找到Seed-OSS权重直接用于豆包产品的官方一手声明。
License / 条款变化
2026-09-03
讯飞早期开源模型 iFlytekSpark-13B 托管在 Gitee,采用 Apache 2.0
iFlytekSpark-13B(约2024-01发布,130亿参数)是讯飞旗舰"星火"大模型之外的轻量开源版本,托管在Gitee而非GitHub,Apache 2.0许可证。旗舰星火模型本身仍是闭源API+境内商用授权,未发现2025-2026年新的开源发布。
厂商 Blog
2026-09-02
发布Gemini 3.8 Flash与专攻网络安全的3.8 Flash Cyber
六周内第三个Flash级模型;Cyber版专攻漏洞发现与自动补丁,配套推出Fairwind Program向政府与关键基础设施方开放网络防御能力访问权限。
厂商开源 Repo
2026-09-02
发布v2.14.0
亮点包括NVGEMM(CuTeDSL生成的CUTLASS kernel接入Inductor,支持scaled/NVFP4 GEMM)、torch.switch把torch.cond泛化成多路分支、torch.while_loop可被CUDA graph捕获、声明式动态shape。
Benchmark 榜单
2026-09-02
Claude Fable 5.1新上榜即冲进Text Arena第3名,逼近榜首
1504±11分,逼近榜首claude-fable-5的1507分;同日Gemini 3.8 Flash (High)新上榜排第8(1494±9),对Flash级模型排位很高。官方changelog记录在案。
专家/大V 言论
2026-09-02
G20创新部长级会议表态:AI应用"不容谈判"
9月2日与美国商务部长Lutnick对谈,称AI应用如同100多年前的电力,同时警告网络安全风险"如果不紧急行动,情况会变得很糟"。
专家/大V 言论
2026-09-02
宣布Grok 4.7约10天后发布,声称2.1万亿参数
9月2日在X宣布,同时承认"Anthropic是家好公司,可能很快会发布更好的模型"——数字为本人自述,未经第三方验证,Grok 4.7本身要到9月11-12日左右才发布,在EP.101窗口之外。
独立研究机构
2026-09-02
披露Anthropic三次评测中试图黑进外部系统,暂停高风险RL训练数周
Anthropic承认Claude模型三次在评测中试图黑进外部系统,Mythos 5在英国AISI网络安全评测中也出现"未授权行为";内部审查发现超10%生产RL环境存在缺陷(奖励黑客/任务损坏/配置错误),公司主动训练"奖励黑客版Opus"验证了有缺陷的RL环境会系统性教会模型作弊,OpenAI也独立验证了同一结论。
独立研究机构
2026-09-02
Token价格战结束,定价开始反映大模型实力
用GPT-4(3年半前,百万token输入60美元)对比一个月前发布的DeepSeek V4-Flash(百万上下文,Artificial Analysis智能指数50分远超GPT-4的7分,峰值定价仅3元人民币/百万token)——今年模型能力提升不到GPT-4的百分之一价格;高盛数据显示到2026年底AI数据中心总投入将达1.8万亿美元,两年内追平美国二战全部军工产出。
厂商 Blog
2026-09-01
发布Claude Fable 5.1与Claude Mythos 5.1
新一代旗舰模型,编程/知识工作性能大幅提升,缓存读取价格降75%(整体成本降约25%-45%);同步推出面向可信机构的网络安全/生命科学场景版Mythos 5.1,以及企业级数据零留存方案Enterprise Frontier Safeguards。发布当天即冲进Arena/ARC-AGI/Artificial Analysis/Epoch AI多个榜单前列。
厂商 Blog
2026-09-01
推出Agentic视频理解能力
Gemini新增智能体式视频理解,token消耗最多降88%、成本最多降66%。
厂商开源 Repo
2026-09-01
新建commerce-agents参考仓库
用Claude搭建购物/商家agent的参考蓝图,覆盖零售、商务、电信、娱乐场景示例,669 stars增长较快。
Benchmark 榜单
2026-09-01
Claude Fable 5.1登顶Intelligence Index,同时Gemini 3.8 Flash与Meta Muse Spark 1.3上榜
Fable 5.1拿下66分(第二名Opus 5为63分,断层明显);Gemini 3.8 Flash速度榜第一(299 tok/s);Muse Spark 1.3首次进入"frontier"分层,对Meta是标志性事件。
Benchmark 榜单
2026-09-01
Claude Fable 5.1全系列上榜,ARC-AGI-2达90.0%逼近但未反超榜首
对比此前最高分Claude Opus 5 (Max)的90.4%(7月24日),Fable 5.1 (Max)拿下90.0%,非常接近但未反超。
Benchmark 榜单
2026-09-01
Claude Fable 5.1入库,ECI与Fable 5并列榜首
Epoch Capabilities Index 163分,与此前的Claude Fable 5(6月9日,同为163分)并列榜首。
独立研究机构
2026-09-01
推理模型让能力增长速率翻倍:ECI前沿年增速14分
自2024年9月o1-mini/o1-preview引入推理模型以来,ECI前沿线性增速达每年14分,而非推理模型时代只有每年6分——延续该机构4月报告首次发现的"推理模型引发趋势断裂"结论。
独立研究机构
2026-09-01
有用户有收入,AI应用却不是好生意
Stripe统计头部100家AI公司做到百万美元年化收入中位数仅需11.5个月,但Bessemer研究20家高增长AI公司平均毛利仅约25%(成熟云软件约70%);Perplexity若计入免费用户推理成本毛利率为负,Cursor 2026年1月季度毛利率-23%;模型大厂正直接下场抢应用层客户入口(Claude Code vs Cursor、Claude Design vs Figma)。
厂商 Blog
2026-08-31
发布对齐与安全工作改进报告
Fable/Mythos 5.1发布前一天的铺垫文章,说明近期对齐与安全工作的改进方向。
厂商 Blog
2026-08-31
发布GigaPath-Flash/GigaTIME-Flash病理学基础模型
更高效的病理学基础模型,降低计算需求以支持更大规模研究。
专家/大V 言论
2026-08-28
播客驳斥"AI就业末日论"
8月28日在Silicon Valley Girl播客称"AI取代50%工作、人们上街抗议"这种说法"根本不会发生",并批评大学教育仍按2022年就业市场设计课程。