发布时间:2026/7/23 22:43:03
Kimi K3 实测:2.8T 参数、100 万上下文,我让它做了网页、PPT 和 3D 游戏 Kimi K3 实测2.8T 参数、100 万上下文我让它做了网页、PPT 和 3D 游戏大家好我是王不二。最近事情实在是太多没有第一时间发布K3的实测请各位粉丝海涵。晚是晚了点但好处是排队的人……并没有变少。反正已经迟到几天了索性把测试做得更扎实些。写在前面为了测它我充了 199先说一件有点肉疼的事。K3 上线后实在太火好几次想白嫖测试K3都很客气的把我拒绝了。于是我一咬牙充了 199 的会员。某种意义上我的钱包比我更先体验了 K3。为了给大家做这期测试也算是下了血本看完觉得有用记得给个三连啦。真金白银换来的第一手上手体验基本可以浓缩成四个字大、慢、强、贵。大是真的大我其实有点不理解Kimi之前大家都说不卷参数不卷参数结果Kimi回回把模型越做越大。上一次也是Kimi率先把模型参数从B级别带到了T级别。这次更狠直接奔着3T去了。照这个膨胀速度以后本地部署党可以彻底死心了甚至很多企业端想要本地部署也可以死心了。也挺好我的显卡释放出来全心全意为我的游戏服务。慢是真的慢这个不单单是我的体验基本用过的都会吐槽。倒不是因为显卡、算力什么的不够导致的回复慢。而是模型想太多一个简单任务也要思考半天还要再校验校验完自己还要再润色。但客观来讲面对复杂问题的时候这种做法还是不错的。所以你能明显感觉到模型在处理复杂任务上很强。强是真的强复杂问题上的思考深度确实换来了质量。这里先不展开了下文有实测。贵也是真的贵API 输出价 $15/百万 token比上一代 K2.6$4/百万 token贵了近 4 倍第三方 Artificial Analysis 跑一轮完整评测烧了 1.3 亿输出 token成本约 2690 美元收获中肯评价“聪明但贵且慢”。连 C 端会员都得分档199 这档才算真正用上完整版——是的就是我充的那档。一、K3 基本情况项目内容发布时间2026 年 7 月 16 日深夜上线17 日官宣WAIC 2026 前夕模型定位旗舰模型面向长程编程、知识工作、推理三类前沿场景参数规模2.8 万亿总参数MoE 架构896 个专家、每 token 激活 16 个上下文长度100 万 token最高输出 1048576 token模态原生多模态输入图/视频/文本输出为文本开源承诺完整权重 2026 年 7 月 27 日前发布技术报告随权重一同公布API 价格缓存命中输入 $0.30 / 未命中 $3.00 / 输出 $15.00每百万 token技术方面完整的技术报告要后续随权重一起发目前能看的只有官方技术博客。KDA 混合线性注意力传统注意力生成每个字都要回头看一遍前面所有的内容——前面有 100 个字看 100 个有 100 万个字看 100 万个。所以很多模型的百万上下文是塞得下、用不起。KDA 这套 Kimi 自研的新机制让回头看的成本不再随长度膨胀不管前面是 1 千字还是 100 万字生成下一个字的成本基本恒定。第三方实测百万 token 下生成速度最高快 6.3 倍具体怎么测的要等 7 月 27 日技术报告确认。极致稀疏 MoE共 896 个专家但每次 token 只激活 16 个极致的稀疏比例。官方称扩展效率比 K2 提升约 2.5 倍相当于同样的算力K3 能学到 K2 两倍半的东西。长程 Agentic Coding官方给了三个案例——从零写出 MiniTriton 编译器、单次自主运行 48 小时设计一颗芯片、官方宣传片自己剪。共同点就一个任务链条长到人都会累它几十小时连续决策不跑偏。官方自曝三大局限这一点Kimi做的还是挺坦诚的。①对思考历史敏感一个任务中最好不要切换模型、②过度主动遇到模糊意图会替你做没让它做的决定、③体验与 Fable 5 / GPT 5.6 Sol 仍有差距。性能跑分接下来看看官方发布的基准对比表K3 和 Claude Fable 5、GPT 5.6 Sol、Opus 4.8 这些第一梯队模型正面刚。Coding 编程六个编程基准K3 拿下两个第一Program Bench77.8和 SWE Marathon42.0。输掉的几项里其实落后的差距也并不大。Terminal Bench 2.1终端命令行操作只差 0.5 分。真正差距明显的是 DeepSWE 和 FrontierSWE都是高难度软件工程任务榜首还是 GPT-5.6 Sol 和 Fable 5。General Agents 通用智能体BrowseComp 深度搜索 91.2 第一、Automation Bench 自动化办公 30.8 第一、SpreadsheetBench 表格处理 34.8 险胜拿下第一。输的主要是两个综合 Elo 评分GDPval-AA 和 AA-Briefcase考的是模拟真实岗位的白领知识工作写报告、做分析、处理文档这类。Visual Agents 视觉智能体两个带工具的视觉推理基准K3 都是第二CharXiv 91.3、Zerobench 41.0榜首都是 Fable 5。但是也算稳稳站在第一梯队。二、实测图形、网页、PPT、3D 游戏先交代测试思路。K3 本身只能输出文本输入支持图像、视频、文本但在线使用时我发现K3有图片生成工具所以我先测了两个图片案例热身再把精力放在 K3 最被看好的代码和生成能力上——网页、PPT、3D 游戏各两个案例。prompt 全部原文照录大家可以直观体会一下。2.1 图形测试案例 1 生成美女直播卖农具的图片。卖的是金锄头标价388。直播元素全齐了左上角直播标 5.8 万观看、环形补光灯、手机支架、背景助农惠农 乡村振兴横幅、左下角弹幕滚动右下角红色价格牌金锄头 ¥388。案例 2生成一张试卷有题目有解答有老师的判分。满分100得分98 因为有错误。保证题目和做对的题都是真实正确的。填空、判断全部正确。最后一道应用题计算正确但漏写单位厘米老师扣 2 分98 分的构成完全合理。美中不足是应该是手写部分的字体看着像打印的太工整了。2.2 网页测试前端代码是 K3 第三方盲投登顶的领域两个案例验证含金量。案例 1 生成一个黑客帝国风格的数字雨动画黑色背景上绿色字符日文片假名数字字母从顶部随机位置下落。在这个上面再加一些正常网页有的内容比如把这个网页改造成一个博客。结果很不错数字雨实时渲染画面流畅不卡顿。内容也是有鼻子有眼比较充实。案例 2生成一个销售数据仪表盘页面包含折线图展示近12个月销售额趋势、饼图展示产品类别占比、柱状图对比各区域业绩。使用 ECharts 或 Chart.js 库数据用模拟数据支持图表联动点击饼图区域折线图只显示该区域趋势KPI 卡片、折线图、饼图、柱状图要素齐全。要说不足的话就是这个页面还是太简单了够用但是没有让我感受到惊艳的感觉当然这个也怪prompt太简单了。2.3 PPT 测试PPT 最能暴露内容策划底细——代码可以搜、版式可以套这几页讲什么全靠模型自己组织。案例 1 生成一个PPT讲讲最近特别火的幻兽啪鲁这个游戏大概5页就好。哈哈哈请原谅我最近玩帕鲁有点上头。像素可爱风PPT结构也很清楚封面“4000 万玩家上头”→ 有多火四张数据卡→ 玩法宝可梦×方舟×打工人模拟器→ 1.0 正式版时间轴 → 后续任天堂官司和玩梗。案例 2帮我做一个专业的有深度的商务场景用的AI讲解PPT10页这个效果完全可以到直接使用的程度我初步看了下格式几乎不用改。下次在讲课就直接用K3生成了。2.4 3D 游戏测试最后的重头戏。官方叙事里有一句话生成可玩 Minecraft 克隆——这话听得我心痒我用两个案例来测测它的效果。案例 1帮我用html 生成一个太阳系模型3D的要求可以放大缩小选中对应的星体还可以仔细查看包括旋转放大什么的这个太赞了效果很好包括各个星球的样式也很完美。地球我认真看了很真实、没毛病其他的星球没仔细比对但应该也不差。案例 2做一个H5的我的世界游戏内容主要是向上攀登。主角有发射蜘蛛丝的能力可以荡蜘蛛丝可以顺着蜘蛛丝拉过去比如一些比较高的地方可以利用蜘蛛丝攀登左键发射右键拉扯。要求场景优美。MC 风浮空岛场景草地方块、树叶、水池、像素云和太阳、一应俱全。机制上也确实实现了使用蜘蛛丝的功能。美中不足是有一些地方设计的不合理并不是每一个平台都能跳上去有一些地方必须使用蛛丝。我认真通关了还挺好玩的

相关新闻

2026/7/23 22:43:03

数据总线技术选型实战:从单端/差分原理到CAN、RS-485应用解析

1. 数据总线技术选型:从基础原理到实战抉择在电子系统设计的江湖里,数据总线选型是个绕不开的“硬骨头”。它不像写代码,逻辑对了就能跑;总线选错了,轻则信号不稳、通信时断时续,重则整个系统在复杂电磁环境…

2026/7/23 22:38:03

CAN/CAN FD调试--笔记1

CAN/CAN FD调试–笔记1 一、CAN 和 CAN FD 的配置差别 1.1 BSR 位的作用:速率切换标志 CAN FD 支持两种比特率: 仲裁段(Arbitration Phase):与传统 CAN 相同的低速速率(用于仲裁,确保兼容性…

2026/7/23 22:38:03

海康摄像头RTSP转换前端浏览器实时播放

背景: 公司运维平台需求:把机房监控接入,可在运维平台web实时查看。 解决方案:前端无法播放RTSP数据,问了deepseek和查看别人的建议,最后决定采用以下方案: 基于 ffmpeg 的 Node 后端推流方案 …

2026/7/24 1:38:16

BMS安全基石:AFE硬件保护机制深度解析与TI bq27750实战配置

1. 项目概述:为什么AFE硬件保护是BMS的“安全底线”?在锂离子电池包的设计中,安全永远是第一位的。我们常说的电池管理系统(BMS)就像一个智能管家,负责监控电池的健康状态、估算电量。但很多人可能不知道&a…

2026/7/24 1:38:16

BQ40Z50-R5高级充电算法解析:从状态机到寿命管理的工程实践

1. 项目概述:为什么我们需要智能充电算法?在锂电池驱动的世界里,无论是你手中的智能手机、脚下的电动滑板车,还是路上的新能源汽车,电池管理系统(BMS)都扮演着“大脑”和“守护神”的角色。而充…

2026/7/24 1:38:16

GLM-5多模态大模型与Agentic Engineering技术解析

1. GLM-5技术架构解析GLM-5作为新一代多模态大语言模型,其技术架构实现了从传统编程范式到智能体工程的跨越式发展。模型采用三阶段训练流程,每个阶段都针对性地解决了不同维度的技术挑战。1.1 预训练阶段技术实现预训练阶段使用27万亿token的超大规模语…

2026/7/24 1:38:16

MSP430低功耗模式与中断唤醒机制深度解析及实战优化

1. 项目概述与低功耗设计核心价值在电池供电的嵌入式设备领域,功耗管理不是锦上添花,而是决定产品成败的生死线。无论是部署在野外、需要数年更换一次电池的环境传感器,还是需要贴身佩戴数周甚至数月的智能穿戴设备,系统设计者每天…

2026/7/24 1:38:16

自编码器原理与应用:从数据压缩到生成模型

1. 自编码器:从数据压缩到生成模型的双重革命我第一次接触自编码器是在处理医学图像数据集时,面对数万张高分辨率CT扫描图,存储和传输成了大问题。传统压缩算法要么损失关键细节,要么压缩率有限。直到尝试用自编码器,才…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/24 0:03:10

不同品牌斜齿行星减速机如何替换?以PX与PAG系列为例

不同品牌斜齿行星减速机如何替换?以 PX 与 PAG 系列为例 一、系列对应不等于型号直接互换 PX 与 PAG 都属于斜齿、方法兰、输出轴式精密行星减速机,结构形式和应用方向具有对应关系。 原设备使用PX系列时,可以优先从PAG系列中寻找替换型号。但…

2026/7/24 0:03:10

jdk8 把list 扁平化成String 多个以逗号分隔

在 JDK 8 中&#xff0c;将 List 扁平化为以逗号分隔的 String&#xff0c;有几种非常简洁且高效的方法。&#x1f680; 推荐方案&#xff1a;使用 Collectors.joining()这是最标准的 Java 8 写法&#xff0c;适用于 List<String>。javaimport java.util.stream.Collecto…

2026/7/24 0:03:10

java 两个 long id 怎么合并成一个long id 并且不重复

“把两个 Long ID 合并成一个唯一的 Long ID&#xff0c;且保证不重复”这个需求&#xff0c;在 Java 里直接做数学上的“完美合并”是不可能的。因为两个 Long&#xff08;各 64 位&#xff09;要合并成一个 Long&#xff08;64 位&#xff09;&#xff0c;在信息论上是有损压…

2026/7/23 23:42:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略&#xff1a;快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…