「AI大模型实录」是《财经》杂志的AI大模型报道栏目,这是本系列的第(17)篇文章。
过去三个月,《财经》研究团队借助Codex,追踪了全球13家主流模型公司/机构2025年1月1日-2026年8月30日在GitHub上的热度。
这13家模型分别是,OpenAI、Anthropic、谷歌Gemini、Meta、xAI、阿里Qwen、DeepSeek、字节跳动Seed、智谱AI、腾讯混元、月之暗面、MiniMax、小米MiMo。
此次追踪的GitHub热度,指标涵盖每个模型的Issue(问题讨论)、PR(Pull Request,代码修改请求)数量。其中既包括GitHub全站范围的Issue/PR,也包括各个模型公司官方Repo(代码仓库)内部的Issue/PR。
这些数据覆盖20个月、87周,并在每周一滚动更新。为此,我们建立了一个小型数据库。
GitHub是全球最大的开发者社区,也是目前少数能够追踪用户真实行为的公开渠道之一。它为观察各家模型公司的开发者热度提供了一扇窗口。
随着越来越多普通用户借助AI Coding(AI编码)工具办公,甚至成为Builder(开发者),专业开发者和普通消费者之间的边界开始变得模糊。GitHub因此能够捕捉到更广泛的用户使用行为。
一款模型被全球开发者使用时,容易在GitHub上留下痕迹。有人通过Issue提问、报错、讨论问题,也有人通过PR修改项目代码,把模型接入自己的项目。模型公司推出新模型、新工具后,通常会在GitHub官方仓库中同步更新,收集开发者反馈。开发者则会直接在这些仓库中讨论问题、反馈Bug,或者提交PR参与改进。
《财经》追踪部分模型公司的Issue/PR发现,一些公司在 GitHub上的开发者行为拐点比财务指标早3个-6个月出现。它可能提供了一个观察模型公司商业化进展的先行信号。
做这个追踪的起因是一个追问:模型发布越来越密集、基准测试不断刷新,但模型公司却很少完整披露收入、Token(词元)调用量。即使公布,这些公司也往往采用有利自己的口径。仅靠模型公司自己披露的数据,很难持续横向比较不同模型的真实使用情况。
《财经》希望找到一个相对客观的公开渠道,观测一款模型究竟有多少用户在真实使用,它的使用情况究竟是如何随周期变化的?

需要说明的是,这个追踪同样也有很多局限性——统计数据不能直接等同于用户数、调用量或市场份额,它只能展现变化趋势作为参考。它可以反映基础语言模型的使用情况,但难以反映视频/视觉模型(如字节跳动的Seedance)的使用情况。因为,视频模型的用户更多是创作者、影视漫剧从业者、广告公司,他们较少在GitHub提交代码。
这次追踪分析中,《财经》在20个月的数据初步发现了一些规律。
其一,模型能力决定一家公司能否在短期内获得开发者关注。模型能否持续保持SOTA(业界领先),会直接影响开发者是否愿意不断使用它。
其二,智能体(Agent)会直接影响模型的黏性。它甚至可以决定一款模型能否真正进入开发者每天使用的工作流。在GitHub上,它对模型公司的Issue/PR影响越来越大。
其三,开发者社区的维护能力决定了模型热度能否持续。持续修复问题、响应Issue、维护Repo、完善工具链,会让一款模型在GitHub上拥有更强的后劲。
Anthropic在GitHub超过OpenAI,比收入反超早五个月
Anthropic和OpenAI是目前全球估值最高的两家模型公司。截至今年7月末,Anthropic年化收入(ARR,单月收入×12)达到650亿美元,估值9650亿美元。OpenAI年化收入超过400亿美元,估值8520亿美元。
Anthropic收入反超OpenAI是在2026年4月。当时,Anthropic年化收入突破300亿美元,当时OpenAI约250亿美元。
但在GitHub,Anthropic反超OpenAI早了近半年。早在2025年11月,Anthropic的Issue/PR数量就已超过OpenAI,并在此后长期领先。这经历了三步。

2025年10月,Anthropic在GitHub官方仓库的Issue/PR数量率先超过OpenAI。这是Claude Code这款AI编码工具推动的。
Anthropic官方仓库Issue/PR数量是2576条,OpenAI是2522条。当时,Anthropic在2025年9月30日发布了Claude Code 2.0。开发者对Claude Code的反馈很积极。Anthropic的Skills仓库当月收到45条PR,全部来自外部开发者;Python版Claude Agent SDK收到55条PR,其中49条来自外部开发者。
2025年11月,Anthropic在GitHub全站Issue/PR开始反超OpenAI。更强的模型,更好的编码工具促成了这个结果。
在这个月,Anthropic发布了Claude Opus 4.5。它被很多开发者视为是一款跨越了生产力拐点的模型,因为它能连续数小时执行任务、编写代码甚至不出错。在同一个月,Anthropic发布了Claude Code桌面客户端,并为用户发放免费Token额度。
Opus 4.5和Claude Code,让Anthropic的模型和智能体(Agent)能力率先质变。Claude逐渐从一个聊天工具,变成参与代码生产和交付的生产力工具。
Claude Code在这背后起到了很大的作用。《财经》追踪GitHub数据发现,2025年11月Anthropic的Issue/PR数量达到39.9万,首次超越OpenAI的33.4万。Anthropic的Issue/PR,有83%来自Claude Code。
Claude Code甚至深度融入到了开发者的工作流——过去开发者需要手写代码,手动提交PR。但是Claude Code可以帮开发者自动提交PR,而且提交PR时,会在提交信息的末尾自动写下“Generated with Claude Code”(由Claude Code生成)的署名。这些自动署名会让Claude Code参与生产的代码留下可追踪的公开记录。
自动留下工具署名这个行为看起来很讨巧。但这不是Anthropic一家的行为。OpenAI的Codex也会留下“Generated by Codex”(由Codex生成)的署名。其他编码工具情况也会留下自己的自动化署名。相比之下,Claude Code留下的足迹明显更多,这说明它被开发者使用更多,在工作流之中融入也更深。
2025年12月,Anthropic的Issue/PR规模全面超越OpenAI。这还是分别剔除Claude Code和Codex留下的自动化署名后的结果。
Claude相关Issue/PR达到10万条,超过GPT的9.3万条。这说明,Anthropic的领先逐渐扩展至更广泛的模型讨论和代码协作。
2026年之后,Anthropic和OpenAI的Issue/PR差距还在逐月扩大。2026年8月,即使剔除编码工具署名后,Claude相关Issue/PR达到107.5万条,是GPT的2.7倍。Anthropic的领先,已经不能用Claude Code的署名机制解释。
这说明,Anthropic借助Claude Code取得了入口优势。
《财经》与多位Claude Code、Codex用户交流发现,两款工具的用户画像存在一定差异:Claude Code用户更偏工程师和重度开发者,对AI工具的使用深度通常更高;Codex的用户范围则更广,也包括较多非专业开发者和知识工作者。
这种差异也能解释为什么Claude Code更容易在GitHub留下大量痕迹。对一款模型来说,用户规模重要,但更重要的是,它能深度融入用户的工作流。
谷歌Gemini仍排名第三,但相对影响力在下降
在全球13家模型公司中,谷歌Gemini仍然稳居第三。
2026年1月1日-8月30日,Gemini相关Issue/PR数量达到177.6万条,占13家公司同期总量的6.2%,仅次于Anthropic和OpenAI。
但第三名掩盖了另一个变化:Gemini的绝对热度仍在增长,相对占比却在下降。
2026年1月,谷歌Gemini相关Issue/PR数量为14.7万条,占13家公司总量的13.4%。到7月,数量增至32.9万条,占比却降至5.8%。截至8月30日,Gemini相关Issue/PR数量回落至22.2万条,占比进一步降至3.7%,已不足年初的三分之一。
与此同时,Gemini与前两名的差距明显拉大。2026年1月,Anthropic的Issue/PR数量约为Gemini的3.7倍,截至8月30日扩大至18.3倍;OpenAI与Gemini的差距也从2.5倍扩大至5.5倍。

谷歌相对影响力下降,和它近半年没有推出新的SOTA级旗舰模型有很大关系。
2026年1月至今,谷歌主要推出了Gemini 3.6 Flash、Gemini 3.7 Flash等强调性价比和效率的模型,Gemini 3.5 Pro等旗舰模型则迟迟没有正式发布。在旗舰模型迟迟没有正式发布的情况下,Gemini的Issue/PR数量也在8月出现回落。
但Gemini能够长期保持第三,一个重要因素是,谷歌仍然拥有强大的生态和分发能力。
2026年8月,Gemini是全球用户规模最大的AI助手之一。Gemini App月活跃用户(MAU)已经超过10亿,一位开发者对《财经》表示,2025年6月之后,谷歌曾在较长一段时间内以低价、优惠等方式向用户提供Gemini会员。在他看来,这也帮助Gemini扩大了在普通消费者中的覆盖面。
Gemini也经常作为可选模型,出现在开源项目、开发工具和AI应用中。2025年6月,谷歌发布开源AI编码工具Gemini CLI。同年8月,Gemini 2.5 Pro进入GitHub Copilot的模型选择器,覆盖VS Code、Cursor等多个开发环境。当年11月,谷歌又推出智能体开发平台Antigravity。
这些接入扩大了Gemini被看见和被适配的范围。但被列入模型选项,并不意味着开发者会持续调用它,更不意味着它已经成为主要的工作流入口。
《财经》追踪GitHub数据发现,2025年1月1日-2026年8月30日,约113.6万条Gemini相关Issue/PR出现了谷歌旗下编码工具Gemini Code Assist、Antigravity、Gemini CLI等关键词,占Gemini相关Issue/PR的48.5%。但这些记录主要涉及讨论、适配、配置等,其中可识别的工具自动署名占比不到0.5%。
相比之下,同期Anthropic和OpenAI的Issue/PR记录中,来自Claude Code、Codex等编码工具工作流的比例分别达到73.7%和72.7%。至少从GitHub上可识别的公开痕迹来看,谷歌的编码工具还没有像Claude Code和Codex一样,形成大规模的自动化署名记录。
Gemini能维持第三,说明谷歌依然拥有强大的模型分发和生态影响力。但它相对份额的下降也说明:成为各种工具里的一个模型选项,和真正成为开发者每天使用的工作流入口,是两件完全不同的事情。
国产模型两强交替,阿里Qwen、DeepSeek长期领先
GitHub上的Issue/PR数量紧随Anthropic、OpenAI、谷歌Gemini的,是两款国产模型——阿里Qwen、DeepSeek。
阿里Qwen、DeepSeek长期位居国产模型前两名,而且一直交替领先。2025年1月-2026年8月,阿里Qwen相关Issue/PR累计达到44.5万条,DeepSeek为39.3万条。两家公司合计占8家国产模型相关Issue/PR的60.5%
《财经》追踪的87周GitHub数据(2025年1月1日-2026年8月30日)显示,在8家国产模型公司中,阿里Qwen有45周的Issue/PR数量排名第一,DeepSeek有42周排名第一。87周的周冠军全部来自这两家公司。

DeepSeek的开发者热度更容易受到重要模型发布推动。它的热度会在模型发布后的随后几周出现爆发式增长。
2025年1月20日,DeepSeek-R1发布时,DeepSeek相关Issue/PR从发布前一周的475条,增至发布后一周的2695条,增长约4.7倍。DeepSeek-V4系列发布时也出现了类似变化。
2026年4月24日,DeepSeek发布并开源DeepSeek-V4-Pro/Flash。DeepSeek相关Issue/PR从发布前一周的4159条增至发布后一周的8609条,直接翻倍。
阿里Qwen的开发者热度同样受到模型发布推动,但它不像DeepSeek主要依靠一两款明星模型形成陡峭的增长曲线,而是更多呈现阶梯式上升。
阿里Qwen一直缺少像DeepSeek-R1/V4系列一样具有爆发效应的明星模型,但它的产品矩阵更完整,大中小参数模型更多,发布频率更高,社区维护也更积极。因此,每一轮模型发布带来的开发者热度更容易延续下来。
2026年4月,阿里Qwen 3.6系列陆续发布。系列发布前后,相关Issue/PR从2616条逐步增至4102条,增长56.8%。阿里Qwen 3.8系列从预览、正式发布到开放权重,相关Issue/PR从7月6日一周的5236条,逐步增至8月17日一周的1.11万条,增长111.5%。阿里Qwen相关Issue/PR增长相对平缓,但持续时间更长。
阿里Qwen团队在GitHub社区运营更积极,是这种后劲的重要来源。2025年1月1日-2026年8月30日,阿里Qwen官方仓库共出现约1.6万条Issue/PR,是DeepSeek的2.5倍。
《财经》在GitHub追踪到的数据显示,阿里Qwen维护了95个官方仓库,DeepSeek官方仓库只有36个。在GitHub上,开发者提交一份代码修改后,需要经过仓库维护者审核。只有被接受的修改,才会被正式合并进项目代码。
2025年1月1日-2026年8月30日,阿里Qwen官方仓库共出现7114个PR,其中5118个最终被合并,占全部PR的72.1%。这一比例是全球13家模型公司中最高的。
阿里Qwen官方仓库的热度更多来自Qwen Code这款开源编码工具。官方仓库的1.58万条Issue/PR中,有1万条来自Qwen Code,占比65.1%。
DeepSeek的情况不同,它的官方仓库热度更加分散。其中既来自DeepSeek-V3、DeepSeek-R1等模型仓库,也来自DeepEP等训练和推理基础设施仓库。DeepSeek-V3仓库占比为20.7%,DeepSeek-R1仓库占比为12.5%,DeepEP仓库占比为11.6%。
这说明,DeepSeek在GitHub上的开发者生态仍然更多围绕模型本身,以及训练、推理基础设施展开。阿里Qwen则是已经出现了一个由Qwen Code主导的开发者工具入口。
DeepSeek官方仓库同样产生了大量讨论和代码修改请求,但PR合并率只有34.5%,明显低于阿里Qwen的72.1%。这说明,相比Qwen,DeepSeek官方仓库收到的PR最终进入项目代码的比例更低。两家公司在GitHub上的开发者生态,也呈现出不同的组织和参与方式。
国产模型第二梯队,智谱、月之暗面、MiniMax紧随其后
2025年国产模型几乎是阿里Qwen、DeepSeek两家独大。但2026年,智谱、月之暗面、MiniMax等第二梯队迅速成长壮大。
《财经》追踪GitHub数据发现,2025年1月1日-12月31日,8家国产模型公司的相关Issue/PR合计达到26.76万条。其中,阿里Qwen为15.35万条,占比57.3%;DeepSeek为7.16万条,占比26.8%。两家公司合计占到84.1%。
剩余6家公司的占比都没有超过10%。智谱GLM为1.61万条,占比6.0%;月之暗面Kimi为8694条,占比3.2%;字节跳动Seed、MiniMax、腾讯混元和小米MiMo分别为5678条、5370条、4239条和2412条,占比分别为2.1%、2.0%、1.6%和0.9%。
2026年,阿里Qwen、DeepSeek高度集中的“双强格局”开始松动。智谱、月之暗面、MiniMax为代表的第二梯队,正在占据更大比重。
2026年1月1日-8月30日,8家国产模型公司的Issue/PR合计达到111.75万条。其中,DeepSeek为32.12万条,占比28.7%;阿里Qwen为29.17万条,占比26.1%。月之暗面Kimi和智谱GLM分别增至15.86万条和15.40万条,占比达到14.2%和13.8%。MiniMax达到11.28万条,占比10.1%。
小米MiMo、字节跳动Seed和腾讯混元分别为3.65万条、3.01万条和1.27万条,占比分别为3.3%、2.7%和1.1%。

智谱、月之暗面、MiniMax都曾在旗舰模型发布或开源后,单周Issue/PR接近第一梯队的DeepSeek、阿里Qwen。
智谱最接近第一梯队是在2026年2月9日-16日。当时智谱GLM的Issue/PR达到2193条,与DeepSeek只相差35条。背后的驱动因素可能是,智谱在2026年2月12日发布并开源GLM-5。
月之暗面最接近第一梯队是在2026年7月20日-27日。当时月之暗面Kimi的Issue/PR达到1.08万条,与阿里Qwen只相差485条。背后的驱动因素可能是,2026年7月16日,月之暗面发布Kimi K3。
MiniMax最接近第一梯队是在2026年4月6日-13日。当时MiniMax的Issue/PR达到4581条,一度超过DeepSeek,短暂升至国产模型第二名。这背后的影响因素可能是,MiniMax在3月18日发布了MiniMax M2.7,并在4月12日开放模型权重。
但三家公司都没有把这种短期峰值稳定维持下来。这说明,重要模型发布可以迅速带来一波开发者关注,但要把一次模型发布转化成持续的开发者活动,还需要更长时间的产品、工具和社区积累。

月之暗面Kimi是第二梯队里一个比较特殊的样本。它不仅模型热度上升,GitHub官方社区也更加活跃。
从官方仓库数量看,月之暗面并不突出。它共维护43个官方仓库,在8家国产模型公司中排名第五,少于阿里Qwen、腾讯混元、字节Seed和智谱。
但这些仓库共产生了6988条Issue/PR,其中2380个PR最终被合并,两项数据均位居8家国产模型公司第二,仅次于阿里Qwen。
这背后的重要推动因素是Kimi Code、Kimi CLI等编码工具。相比单纯依赖模型仓库,这些面向开发者日常使用的工具,为月之暗面带来了更多持续的Issue、PR和代码协作。

在第二梯队内部,智谱和月之暗面的Issue/PR规模已经基本接近,MiniMax与前两者仍存在一定差距。
2026年1月1日-8月30日,月之暗面和智谱相关Issue/PR分别为15.86万条和15.40万条,只相差约3%。MiniMax为11.28万条,分别比月之暗面和智谱低28.9%和26.8%。
智谱先后推出GLM-5、GLM-5.1、GLM-5.2、GLM-5.3,这几款模型都在持续强化编码和长程智能体能力。月之暗面相继推出Kimi K2.6、Kimi K2.7 Code和Kimi K3,Kimi K3的能力达到了全球SOTA水平。尤其是智谱GLM-5.2、月之暗面Kimi K3发布后,两家公司的GitHub热度都连续数周明显增长。
MiniMax在推出M2.5、M2.7两款受欢迎的模型后,又在2026年6月推出旗舰模型M3。M3发布当周,MiniMax相关Issue/PR一度增长52.5%,并短暂领先智谱和月之暗面,但随后热度较快回落。与智谱GLM-5.2和月之暗面Kimi K3相比,MiniMax M3在GitHub上带来的开发者热度相对有限。
智能体,对开发者热度的影响越来越大
2025年1月,全球13家模型公司相关Issue/PR约为5.3万条。2026年8月,这一数字增至595.1万条,是此前的111.9倍。其中,PR占比从53.9%升至88.5%,Issue占比则从46.1%降至11.5%。
这意味着,模型正在以前所未有的速度进入真实的软件开发流程。开发者不再只是在GitHub上讨论模型,而是越来越多地用模型修改代码、提交PR,参与日常开发工作。
8家中国模型公司的绝对热度也在快速增长。同期,中国模型相关Issue/PR从8702条增至31.2万条,增长至原来的35.9倍。
但放到全球范围内看,8家中国模型在GitHub上的相对热度反而在下降。2025年1月,中国模型相关Issue/PR占全球13家模型公司的16.4%。到2026年8月,这一比例已经降至5.2%。

中国模型并不是性能不强,也不是没有开发者真正使用。一个越来越重要的影响因素是,中国模型还缺少像Claude Code、Codex一样被全球开发者广泛使用的智能体和工作流入口。
《财经》追踪统计发现,2026年8月,全球13家模型公司在GitHub上的相关Issue/PR达到595.1万条,其中370.1万条与AI编码工具相关,占比62.2%。其中又有约233.9万条直接出现Claude Code或Codex的自动署名,占全部Issue/PR的39.3%。
如果从13家公司Issue/PR总量中剔除可识别的Claude Code、Codex自动署名记录,8家中国模型的占比会从5.2%升至13.9%。
这说明,国产模型相对份额下降并不完全来自模型本身。一部分来自更广泛的全球开发者生态差距,另一部分则来自Claude Code、Codex等工具对开发者工作流入口的占据。这说明智能体已经成为一个无法忽略的变量。
更重要的变化是,GitHub上的模型热度的来源本身正在发生变化。
过去,开发者更多通过Issue讨论模型、反馈问题,通过PR把模型接入自己的项目。现在,当Claude Code、Codex等智能体直接修改代码、提交PR时,越来越多的GitHub活动开始由智能体工作流产生。
这也意味着,GitHub记录到的未必只是底层模型的影响力。开发者通过智能体修改代码时,GitHub更容易留下工具本身的名称和署名,底层调用的模型未必获得同等程度的可见度。谁控制了开发者的Agent入口,谁就更容易在GitHub留下大量公开痕迹。
GitHub当然不能代表国产模型的全部使用情况。国产模型在国内云平台、企业私有代码库中被调用时,并不一定会在GitHub留下记录。但GitHub仍然能够观察一款模型在全球开源开发者生态中的影响力。对希望走向全球市场的中国模型公司而言,这仍然具有战略意义。
这20个月的数据最终指向同一个变化:一款模型能否被开发者深度使用,已经越来越不只取决于模型性能。模型决定开发者愿不愿意尝试,社区决定热度能不能延续,而智能体决定模型能不能真正进入开发者每天使用的工作流。
谁能抢占智能体和工作流入口,谁就更容易把模型能力转化成持续的开发者热度。
(备注:文章中的数据来自《财经》近三个月对全球13家模型公司GitHub开发者热度的持续追踪,数据覆盖2025年1月至2026年8月,共20个月、87周。为此,我们维护了一个小型数据库,并在每周一滚动更新。如果对数据口径、统计方法或某款模型的变化趋势感兴趣,欢迎随时交流。)
10.10.248.70, 216.73.216.71
