发布时间:2026/8/29 21:47:59
Qwen3.8-Flash 来了,100万上下文、Agent、Coding 都加强了 关注 霍格沃兹软件测试开发 公众号回复「资料」, 领取人工智能测试开发技术合集8 月 26 日Qwen 团队发布了 Qwen3.8-Flash-Next。这次更新有几个信息很抓眼球125B 主模型参数每个 Token 只激活约 6B原生支持 26 万 Token 上下文可扩展到 100 万Coding、Agent、工具调用能力继续增强。同时Qwen Cloud 上的生产版本命名为 Qwen3.8-Flash默认就是 100 万 Token 上下文。如果只是日常聊天这些数字可能没那么有感觉。但如果你是开发、测试、运维或者其他 IT 从业者这次更新其实很值得看。因为从 Qwen3.8-Flash 身上能看到一个越来越明显的趋势大模型正在从“回答问题”继续往“完成工作”走。而软件研发恰好是这一轮变化最明显的场景之一。Qwen3.8-Flash模型体验地址技术报告https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf技术博客https://qwen.ai/blog?idqwen3.8-flash-nextHugging Facehttps://huggingface.co/Qwen/Qwen3.8-Flash-Next?spma2ty_o06.30285417.0.0.1d73c921FsyOPefileQwen3.8-Flash-NextModelScopehttps://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spma2ty_o06.30285417.0.0.1d73c921XAP2dVfileQwen3.8-Flash-Next千问AI平台https://www.qianwenai.com/models/qwen3.8-flash01 先说最直观的上下文来到 100 万 TokenQwen3.8-Flash-Next 原生上下文长度达到 262,144 Token并且可以扩展到 1,000,000 TokenQwen Cloud 提供的 Qwen3.8-Flash 则默认支持 1M 上下文。100 万上下文到底意味着什么以前使用 AI Coding很多人的操作是复制一段代码 → 丢给模型 → 问它哪里有问题。或者测试同学复制一段需求 → 让模型生成测试用例。这当然能用但跟真实的软件工程还有很大距离。因为真正做一个项目模型要理解的东西远不止一段代码。比如一个支付需求改动测试人员可能同时要看PRD 和需求变更接口文档前后端代码数据库表结构上下游服务历史测试用例历史 Bug日志Git Commit / Diff监控信息过去最大的一个问题就是这些东西根本塞不进去。上下文越来越长之后AI 才有机会从“看懂一个文件”逐渐走向“理解一个项目”。当然100 万 Token 不代表把整个公司代码库一股脑塞进去就完事了。真正落地依然涉及代码检索、知识库、上下文管理、权限控制等工程问题。但模型能够处理的上下文上限提高确实给复杂研发任务提供了更大的空间。02 Coding 能力已经不是“帮你补几行代码”了这次 Qwen 官方给出的测试成绩里Coding 是一个明显重点。例如SWE-bench Pro62.5SWE-bench Multilingual81.0DeepSWE 1.158.7这些 Benchmark 和以前单纯考“写一道算法题”不太一样更偏向真实软件工程理解代码仓库、定位问题、修改代码、解决 Issue。([Qwen][1])这也是最近 AI Coding 最明显的一次变化。前两年大家谈 AI 编程更多想到的是“帮我生成一个 Java 方法。”现在已经越来越像“你自己去代码仓库里找问题然后把它解决掉。”这两件事不是一个量级。现在 Codex、Claude Code、Qwen Code 这类 Coding Agent 的工作模式越来越接近读取代码 → 搜索项目 → 分析依赖 → 修改文件 → 执行命令 → 跑测试 → 根据结果继续调整。甚至这次 Qwen 官方已经专门给出了接入 Claude Code 和 Codex 的方式Qwen API 同时兼容 Anthropic 协议和 OpenAI Responses 协议。所以如果现在对 AI Coding 的理解还停留在“代码补全工具”其实已经有些滞后了。03 Agent 能力也在明显加强图片另外一个值得关注的关键词就是Agent。这次 Qwen3.8-Flash-Next 在官方公布的 Toolathlon Verified 工具调用评测中拿到了 73.5长流程办公任务 CoWorkBench 为 73.9。分数本身不是最重要的。重要的是现在厂商越来越重视一件事模型能不能自己调用工具完成任务因为聊天模型和 Agent 最大的区别之一就在这里。你问 ChatGPT“帮我分析一下为什么这个接口测试失败了。”它给你一段分析这是 AI 助手。但如果它可以自己读取接口文档 → 调测试平台 → 执行接口 → 获取 Response → 查询日志 → 查看数据库 → 分析原因 → 修改测试脚本 → 再执行一次这时候性质就完全不一样了。它已经开始进入真正的软件研发流程。04 这件事对测试行业影响其实更直接为什么我们一直强调测试从业者要关注 Agent因为测试工作天然就适合被拆成大量“工具调用”。举个很现实的例子。现在很多测试团队已经开始使用 AI 生成测试用例需求文档↓大模型↓测试用例这属于第一阶段。但再往后发展很可能变成读取需求↓分析代码 Diff↓查询历史 Bug↓识别影响范围↓生成测试用例↓调用自动化测试平台↓执行测试↓读取失败日志↓分析异常↓输出测试报告这里面只有其中几步是在“生成内容”。剩下的大部分工作本质上都是模型 工具 工作流。所以未来 AI 测试真正的核心很可能不是单独研究Prompt 怎么写得更好而是研究怎么让模型拥有完成测试任务所需要的上下文和工具。这就涉及到企业知识库、RAG、MCP、Tool Calling、Agent、自动化测试平台、CI/CD。这些东西开始逐渐连起来了。05 100 万上下文对测试其实特别有用测试工作的一个特点是信息非常散。需求在需求平台。代码在 Git。测试用例在测试管理平台。Bug 在 Jira。接口文档在 Swagger。日志在 ELK。监控又在另外一套系统。一个经验丰富的测试工程师之所以能判断风险很多时候并不是因为他会执行多少测试用例。而是因为他能把这些信息串起来。例如这个接口虽然只改了一个字段但它会不会影响订单状态这个模块以前是不是出过类似 Bug这次代码修改到底影响到了哪些下游服务哪些历史测试用例需要重新执行这类问题其实非常吃上下文。长上下文 代码能力 企业知识库组合起来之后AI 才更有可能真正参与需求理解变更影响分析测试范围判断历史缺陷关联测试用例生成而不是每次只看一小段材料然后给一个看起来正确、实际上不了解业务背景的答案。06 还有一个容易被忽略的变化成本AI 真正进入企业之后不能只看模型强不强。还有一个非常现实的问题贵不贵。如果一个测试 Agent 每天要反复读取代码、需求、日志再调用十几次甚至几十次模型那么调用量和普通聊天完全不是一个级别。Qwen 官方披露Qwen3.8-Flash-Next 相比 Qwen3.7-Plus训练成本约为后者的 1/9同时也在降低推理成本。其架构采用 125B 主模型但每 Token 只激活约 6B 参数。官方在发布时给 Qwen3.8-Flash 公布的 Qwen Cloud 定价为输入0.16 美元 / 百万 Token输出0.47 美元 / 百万 Token。截至 8 月 26 日官方发布文章时API 标注为即将开放。这其实是 Flash 模型很重要的一层意义。企业需要的未必永远是“能力最强的那个模型”。很多业务真正需要的是能力足够强同时速度、成本、吞吐量也能接受。尤其是自动化测试、客服、代码 Review、日志分析这类高频任务。一天跑几次和一天跑几十万次完全是两套经济账。07 这还是一次 Qwen4 架构的“提前剧透”这次发布还有一个值得关注的点。Qwen 官方明确表示Qwen3.8-Flash-Next 同时也是 Qwen4 新架构的一次提前预览。这次主要调整了四个方向Attention、Residual、Embedding、Optimization。其中一个比较容易理解的是 Qwen Sparse AttentionQSA。长上下文最大的麻烦之一就是上下文越长Attention 的计算和显存访问成本越高。QSA 的思路可以粗略理解成不是每次都把前面所有内容重新仔细看一遍而是先找到真正重要的内容再重点关注。Qwen 官方给出的测试中在 100 万 Token 上下文下QSA Attention Kernel 的 Prefill 和 Decode 最高分别实现 7.6 倍和 4.9 倍加速。对于普通用户来说不需要研究这些架构细节。但这背后的方向其实很清楚模型越来越大但每次计算不一定越来越贵上下文越来越长但不能简单靠堆算力解决Agent 越来越复杂对推理效率的要求反而越来越高。这也是下一代模型架构正在重点解决的问题。08 测试工程师真正要关注的不是哪家模型跑分第一现在几乎每隔一段时间就会发布一个新模型。今天 Qwen明天 DeepSeek后天可能又是 Claude、Gemini 或 GPT。如果每一个模型出来我们都只是比较谁参数更大、谁 Benchmark 高了两分、谁又超过谁了。其实意义并没有那么大。对于测试从业者更值得关注的是模型能力变化背后的工作方式变化。从最近这一轮模型更新来看几个方向已经越来越清楚长上下文让 AI 能理解更多项目级信息。Coding让 AI 从生成代码走向修改真实代码仓库。Tool Calling让 AI 可以连接测试平台、数据库、浏览器、命令行和内部系统。Agent让 AI 可以把这些能力串起来连续完成一个复杂任务。这几个能力如果单独看都不算特别新。但当它们逐渐组合到一起之后软件测试的工作方式就会开始发生变化。写在最后Qwen3.8-Flash 这次发布我觉得真正值得关注的并不是某一个跑分。而是一个越来越明显的信号大模型正在从“给答案”走向“做事情”。对于测试行业来说也是一样。AI 测试的下一阶段很可能不会只是帮我们多生成几条测试用例。而是让 AI 真正进入需求分析、代码理解、风险识别、用例设计、自动执行、问题定位和质量反馈。测试工程师当然没必要看到一个新模型就开始焦虑。但有一件事情值得提前准备过去我们学习的是怎么使用测试工具接下来我们还要开始学习怎么把 AI 变成测试工具的一部分。而 Qwen3.8-Flash 这次更新的 100 万上下文、Coding、Agent 和 Tool Calling恰好都在把这件事情往前推。本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容侧重测试实践、工具应用与工程经验整理。

相关新闻

2026/8/29 21:47:59

爱奇艺前端笔试复盘:从JS机制到手写代码的校招考点解析

爱奇艺2018秋季校招前端工程师(第一场)笔试复盘周末帮一个学弟整理笔试题,翻出了爱奇艺2018秋季校招前端工程师(第一场)这套卷子。回想当年我自己也参加过这场笔试,一晃几年过去,如今站在面试官…

2026/8/29 21:47:59

DeepSeek V4-Pro闪电二连击:国产大模型正在改写什么规则

关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集 没有发布会,没有预告,它悄悄上线了——然后整个行业都睡不着了 大家好,我是某互联网公司的技术架构负责人。 上周三凌晨,团队群里突然弹…

2026/8/29 21:42:58

ROS通信核心:roscpp实现Topic与Service的C++编程实战

1. 项目概述:从零到一掌握ROS通信核心搞机器人开发,ROS是绕不开的一环。很多朋友在学完基础概念后,面对第一个实际要写的C节点时,常常会卡壳:消息(Topic)和服务(Service)…

2026/8/29 21:58:00

蓝桥杯单片机备赛指南:从模块驱动到多任务系统设计

1. 项目概述:一份“过来人”的蓝桥杯单片机备赛指南如果你正在为蓝桥杯单片机比赛埋头苦干,或者刚拿到开发板一脸茫然,那么这份资料或许能帮你少走不少弯路。我花了相当长的时间,把历届蓝桥杯单片机电子类省赛和国赛的题目、考点、…

2026/8/29 21:58:00

游戏客户端开发笔试全解析:从C++到A*寻路的备考指南

做游戏客户端开发这些年,我经手过不少校招简历,也批过不少笔试卷。每年秋招季都有人问我同一个问题:游戏客户端开发的笔试到底在考什么?很多人把大量时间砸在刷算法题上,结果上了考场发现题型完全对不上。网易2018校招…

2026/8/29 21:58:00

Zed 字体配置实战:5分钟配好,3套场景配方直接抄

Zed 字体配置实战:5分钟配好,3套场景配方直接抄 【免费下载链接】zed Code at the speed of thought – Zed is a high-performance, multiplayer code editor from the creators of Atom and Tree-sitter. 项目地址: https://gitcode.com/GitHub_Tren…

2026/8/29 21:58:00

游戏服务器开发校招笔试:核心考点与实战解析

游戏服务器开发这个领域,说起来也算是个“老牌”方向了。这些年我面试过不少人,自己也带过团队,回头再看网易2018年这套校招笔试卷,依然觉得它非常经典——考点覆盖扎实,难度梯度合理,几乎没有偏题怪题&…

2026/8/29 21:52:59

游戏开发校招笔试攻略:畅游真题考点与C++算法复习路线

“搜狐畅游2017游戏开发校招笔试题”这个话题,放到今天回头看,依然值得拿出来认真复盘。畅游作为国内端游时代一路走下来的老牌厂商,技术校招的出题风格在行业内一直很有代表性——不搞偏题怪题,重点考察C功底、数据结构、算法思维…

2026/8/29 21:30:11

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/29 0:01:10

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:01:10

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:01:10

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…