实测Kimi K3:强得意外,慢得着急
日期:2026-07-20 20:53:53 / 人气:20

能力上限高,但体验还没完全跟上。
AIX财经(AIXcaijing)原创
月之暗面最近动作不断。7月16日晚间,团队悄悄上线全新大模型Kimi K3,数小时后才通过官方公众号发布正式公告。
这款新机的预热全程“半公开”,热度在官宣前就已彻底拉满。此前,代号“Kivine”的匿名模型现身大模型竞技场Arena榜单,凭借亮眼的前端生成、3D任务表现引发行业密集讨论,被开发者普遍证实为即将发布的Kimi K3,频繁与Anthropic Fable 5、OpenAI GPT-5.6 Sol两大海外旗舰模型对标。与此同时,Kimi开放平台短暂泄露K3上线限时充值活动页面,虽火速下架,但相关截图广泛传播,让这款国产新模型提前锁定超高关注度。
先看核心硬件参数与产品定位。Kimi K3搭载2.8万亿参数,具备原生视觉理解能力,支持100万Token超大上下文窗口,长文本处理能力大幅升级。值得注意的是,完整上下文权限与会员等级深度绑定、分层开放:最低档位Andante(49元/月)无K3调用权限;中端档位Moderato(99元/月)仅支持256K上下文;高端档位Allegretto(199元/月)及以上,才可解锁完整1M超长上下文能力。
官方将其定义为全球首个开源3万亿级别旗舰模型,主打长程编程、复杂知识工作、深度逻辑推理等前沿智能场景。此次官宣极具诚意,连品牌宣传视频都由Kimi K3独立完成——模型自主完成56段原始素材的选片、卡点、动作匹配与音频合成,直观展示了其独立完成复杂全链路创作的能力。
官方成绩单覆盖编码、通用Agent、视觉Agent三大核心赛道,综合排名稳居全球第三,多个细分维度实现登顶。更具含金量的是公开盲测数据:Arena凌晨更新的Code Arena前端编程榜单中,Kimi K3以1679分拿下全球第一,超越Claude Fable 5(1631分)与GPT-5.6 Sol(1618分)。依托用户匿名盲测、赛后解锁模型身份的机制,这份成绩规避了人为优化偏差,真实验证了其顶级的前端工程能力。
目前Kimi K3已全量上线网页端、App、Kimi Work桌面端、Kimi Code及API接口,默认开启Max顶配思考强度,Low、High轻量化模式将在后续迭代更新。价格层面具备极强海外竞争力:API输入单价每百万Token20元、输出100元,折合输出单价不足14美元。对比海外旗舰,GPT-5.6 Sol输入5美元、输出30美元,Fable 5输入10美元、输出50美元,K3成本优势显著。但纵向对比自家前代产品,Kimi K3较K2.6输入价格上涨3倍多,输出价格涨幅接近4倍,国内用户使用成本明显提升。
月之暗面并未刻意美化产品,官方博文坦诚公布三大核心局限:一是模型对历史思考内容高度敏感,中途切换模型会大幅拉低输出质量;二是训练数据偏向长程高难任务,处理简单日常问题时,容易过度解读、替用户主观决策;三是综合用户体验、工程稳定性,与Fable 5、GPT-5.6 Sol仍存在明显差距。
榜单成绩亮眼、参数规格拉满,这款被视作国产标杆的开源模型,真实落地体验究竟如何?我们结合全网实测案例与自研场景测试,全方位拆解Kimi K3的优势与短板。
01. Kimi K3实测:3D视觉惊艳,速度成致命短板
Kimi K3上线24小时内,海外X平台已涌现大批量实测案例,核心测试场景集中在3D交互生成、前端编程、视觉设计三大领域。全网实测共识高度统一:3D与视觉生成能力越级亮眼,前端UI设计水准逼近海外顶级模型,编码能力跻身第一梯队,但尚未超越头部闭源产品,而推理生成速度是贯穿所有场景的最大硬伤。
多位开发者实测验证,Kimi K3综合能力全面超越两个月前发布的Opus 4.8。虽暂未完全追平GPT、Claude顶级闭源模型,但国产开源与海外旗舰的技术代差,已被大幅压缩。
第三方博主提前拿到匿名测试版,开展高难度3D场景对标测试:让Kimi K3与GPT-5.6 Sol(extra high模式)分别生成体素死星壕沟飞行场景。实测结果显示,GPT-5.6 Sol胜在光影特效细腻度,而Kimi K3画面流畅度更优、动态衔接更自然。模型正式发布后,该博主再次实测,依托K3能力复刻《CS:GO×Portal》独立小游戏,仅通过三轮对话、消耗60万Token完成全流程开发,按API定价总成本仅3.24美元,印证了其低成本落地复杂工程场景的潜力。
视觉精细化能力同样突出。樱花盆景SVG生成测试中,Kimi K3对树干扭曲纹理、树冠分层细节的还原度,精准度甚至超越Fable 5;水流物理仿真测试里,可完美复刻动态水波纹效果,全程保持物理逻辑连贯、无违和穿模。
为还原真实用户体验,我们开展多场景标准化实测,覆盖行业研究、3D场景、前端工程、艺术设计、视频剪辑五大核心场景。
首先是通用办公场景,我们指令Kimi K3生成一份含时间线、树状图、瀑布图的端侧AI行业研究报告。最终成品结构清晰、章节层层递进,产业链、市场规模、发展脉络完整闭环,信息密度与视觉排版质感出众,无逻辑割裂问题。短板在于数据维度单一,仅引用智次方研究院、集微半导体大会两大信源,缺乏多源数据交叉验证,专业性略有欠缺。
3D交互生成场景测试中,我们指令其通过Three.js制作带昼夜循环、高低建筑、街道绿植、穿城河流的可探索微型城市。模型完整落地所有核心元素,画面配色和谐、整体设计感突出,但细节打磨不足,出现树木、路灯遮挡道路的不合理布局,空间逻辑仍有瑕疵。
前端编程场景,我们选用GitHub开源高难度考题,要求实现具备数学计算、几何建模、物理仿真的化学实验交互演示。成品亮点鲜明:化学泡沫涌出、扩散节奏贴合真实反应逻辑,粒子质感真实自然;但存在明显功能遗漏,瓶身默认不透明,无法展示内部液面变化,对容器类物理渲染做了过度简化。
艺术视觉设计场景,我们让其打造莫奈《睡莲》风格沉浸式全景世界。模型精准复刻原作色彩与氛围感,支持场景、船速、天色自定义调节,但动态交互存在BUG,船只穿行睡莲时会出现花草穿透船体的错位问题,物理空间渲染精度不足。
视频剪辑能力测试中,我们提供2026世界人工智能大会素材、海报、议程文案,指令生成30秒官方宣传片。Kimi K3具备自主质检修正能力,不会直接输出粗剪成品,整体成片完成度达标,自动匹配背景音乐与口播旁白;缺陷是口播音量过低、辨识度差,且生成耗时近两小时,效率极低。简单短视频场景,人工操作速度更优;仅大批量素材、全流程粗剪的重度需求,适配其能力优势。
多轮实测总结核心特征:Kimi K3拥有顶尖的审美直觉与创意生成能力,3D、视觉、艺术创作是核心优势赛道;但工程迭代效率、推理速度、一次性准确率存在明显短板。同难度场景生成耗时,普遍是GPT-5.6 Sol的2-3倍,复杂瀑布场景生成近半小时,视频剪辑耗时超一小时。速度短板或源于2.8万亿超大参数推理算力消耗高、默认Max深度思考模式、推理基础设施尚未完全扩容,后续Low/High轻量化模式上线后,体验有望优化。整体而言,这是一款上限极高、落地体验尚未完全成熟的旗舰模型。
02. Kimi K3 vs GPT-5.6 Sol:Sol稳准高效,K3审美出圈
为精准定位Kimi K3的行业段位,我们选取当前顶级闭源模型GPT-5.6 Sol开展三轮同Prompt对标实测,从速度、稳定性、审美、工程准确率四个维度,直观对比两款旗舰模型的差异化优势。
场景一:第一人称3D迷宫游戏生成
测试需求:制作支持WASD+鼠标操控、带小地图探索、火炬动态照明、60秒倒计时、胜利弹窗的完整3D迷宫游戏,综合考核算法逻辑、3D渲染、交互设计、视觉效果整合能力。
两款模型差异极其鲜明。GPT-5.6 Sol主打高效稳健,Kimi K3仍在渲染加载阶段,Sol就已输出可直接运行的成品,多轮实测稳定零BUG,画面写实规整、功能完整,是标准的“不出错商用版本”。
Kimi K3耗时是Sol的2-3倍,速度短板突出,但成品差异化优势明显:自带像素艺术风格,火炬光影、墙面纹理细节更丰富,暗场氛围拉满,游戏辨识度与可玩性更高。
场景结论:追求快速落地、稳定可用选GPT-5.6 Sol;愿意牺牲时间成本,换取高审美、高创意质感的差异化成品,优先选择Kimi K3。
场景二:水杯倒水物理仿真建模
测试选用GitHub开源复合型工程考题,要求实现水杯蓄水、倒水的完整物理仿真,考核数学建模、空间物理直觉、图形学处理、边缘异常处理能力,是检验模型工程严谨度的核心场景。
GPT-5.6 Sol完美通关,一次性输出合规成品:蓄水阶段水粒子贴合容器边界、无穿模泄漏;倒水阶段水流轨迹自然,完全贴合现实物理规律,工程可靠性拉满。
Kimi K3出现明显翻车,首次生成存在两处致命BUG:蓄水时水粒子穿透杯壁泄漏,倒水时水流从杯底溢出,空间推理精度不足。经人工提示修正后可完成需求,但迭代速度缓慢,一次性准确率远不及海外旗舰。也印证了官方所述的体验差距,其视觉空间推理能力尚未完全落地到工程实操中。
场景结论:严谨工程仿真、高精度物理建模场景,GPT-5.6 Sol优势显著,Kimi K3仍需优化迭代。
场景三:尼亚加拉大瀑布3D全景视觉设计
测试需求:基于Three.js制作沉浸式瀑布全景,要求实现玻璃质感绿水、透光白水幕、自然水汽效果,还原真实场景氛围感,重点考核视觉审美与细节落地能力。
GPT-5.6 Sol秉持一贯的“稳而平庸”,功能完整、无BUG,严格匹配提示词要求,但成品质感敷衍:核心水场景仅用白色粒子堆砌,无透光、水汽质感,提示词明确要求的彩虹元素直接缺失,仅完成基础功能,毫无审美溢价。
Kimi K3精准拿捏视觉质感,耗时近半小时完成全流程生成,完整还原绿水玻璃质感、氤氲水汽效果,补全了Sol缺失的彩虹元素,整体光影、层次、氛围感远超竞品,艺术表现力断层领先。
三轮对标总结论:GPT-5.6 Sol是高效、稳定、高可靠的工程工具,强项是快速交付可用成品,短板是审美同质化、缺乏创意;Kimi K3是高上限、高审美、慢迭代的创作工具,优势集中在视觉艺术、创意场景,短板是速度慢、一次性准确率低、需要人工二次修正。
03. 结语:高增长背后,K3是IPO前的能力宣示
Kimi K3的产品迭代,背靠月之暗面飞速攀升的资本与营收增速。2025年12月,月之暗面完成5亿美元C轮融资,投后估值43亿美元;2026年5月,再获20亿美元融资,估值突破200亿美元;6月底新一轮融资启动,投前估值升至315亿美元,半年估值暴涨7倍。
营收增长同样迅猛,验证了商业化落地能力。2026年3月,Kimi年度经常性收入ARR突破1亿美元,6月中旬飙升至3亿美元,三个月实现三倍增长。更亮眼的是,这份增长是在模型持续涨价的背景下完成的:此前K2至K2.7 Code涨价60%,营收依旧稳步攀升;而K3涨价幅度更为激进,后续市场接受度、客户留存情况仍待市场验证。
当前Kimi收入结构高度集中,API接口贡献超七成营收,且海外API收入已超越国内,国际化落地成效显著。订阅数据更是佐证了海外用户付费意愿,Stripe数据显示,Kimi个人订阅用户1月支付订单环比暴涨8280%,2月再增123.8%,成功闯入Stripe全球榜单前十,成为首个跻身该榜单的中国AGI产品。
月之暗面搭建了清晰的商业化飞轮:开源模型吸引全球开发者入驻,开发者工具深度融入产业工作流,再将高稳定性、高时效性需求的开发者转化为付费API客户,营收反哺模型训练与算力迭代,形成技术-流量-商业化闭环。但这套逻辑能否持续跑通,仍需验证开发者留存率、API客户转化率、长期复购数据。
行业维度,AI赛道统计口径已发生根本性变革,传统软件市场份额与大模型ARR营收出现明显错位。IDC 2025年中国AI编程市场报告显示,行业总规模3.99亿元,阿里Qoder以47.6%份额登顶,智谱CodeGeeX以11.5%位列第二。但同期数据显示,智谱半年ARR暴涨15倍至10亿美元,远超传统软件市场规模。这意味着AI行业价值兑现,已从传统软件售卖,全面转向API调用、订阅制的新型商业模式,行业竞争进入全新阶段。
在此背景下,月之暗面与智谱的头部竞争,不再是单一市场份额的比拼,而是增长速度、盈利质量、商业化可持续性的综合较量。两者处于不同发展阶段:未上市的月之暗面核心是兑现增长故事、释放技术远期空间;已上市的智谱需要持续验证营收兑现、成本控制与盈利路径。但双方共同证明,AI编程付费市场需求远超行业预期,赛道红利持续释放。
从发展节点来看,Kimi K3的发布极具战略意义。正值月之暗面筹备港股IPO的关键阶段,这款旗舰模型不仅是常规产品迭代,更是一次面向资本市场的技术能力公开宣示。但IPO的终极考核,从来不是榜单排名与短期热度,而是3亿美元ARR能否持续、付费客户能否稳定留存、推理成本能否有效压降、技术优势能否长期领跑。
回望国产大模型发展节奏,18个月前行业还在讨论能否追上GPT-4,如今国产顶级模型已能正面对标Claude Fable 5、GPT-5.6 Sol全球顶级产品。Kimi K3并非完美的赶超者,但它用实打实的实测表现证明:国产开源大模型,已经具备与海外顶级巨头正面掰手腕的硬核实力。
*题图来源于月之暗面Kimi微信服务号*
作者:恒耀平台
新闻资讯 News
- 太空算力:当AI竞争开始延伸到地...07-25
- AI战争(美国篇):硅谷权力暗战...07-25
- 梅西23岁拿不到的冠军,为什么35...07-25
- 砸60万打水漂、加盟商集体讨伐!...07-25

