TID质量竞争大会分享议题丨正元智晟科技CEO:大模型时代,软件测试如何做到可证可信?

发布时间:2026/9/20 9:38:59

TID质量竞争大会分享议题丨正元智晟科技CEO:大模型时代,软件测试如何做到可证可信? 关注 霍格沃兹软件测试开发 公众号回复「资料」, 领取人工智能测试开发技术合集大模型正在重构软件研发流程。过去写需求、写代码、写测试用例、写自动化脚本都需要人一点点拆解、设计和实现。现在大模型几分钟就能生成一批测试点十几分钟就能写出自动化脚本甚至可以根据需求文档直接输出测试方案。看起来测试效率被大幅提升了。但很多团队真正落地之后会发现一个更棘手的问题大模型生成的测试内容看起来很完整但到底靠不靠谱它有没有漏掉关键边界它有没有覆盖异常路径它生成的测试结论能不能被复核如果业务出现问题我们能不能说清楚为什么当时认为这个版本是可以发布的这才是大模型时代软件测试真正的核心矛盾。不是“AI 能不能生成测试内容”而是“AI 生成的测试内容能不能被相信测试结论能不能自证”。在本届TID质量竞争大会上正元智晟科技 CEO 杨长春将带来主题分享《大模型时代软件测试如何做到可证可信》这场分享不只是讨论 AI 如何生成测试用例而是进一步回答一个更关键的问题当 AI 开始参与软件研发和质量保障我们如何证明测试过程可信、测试结论可信、质量决策可信一、为什么 TID质量竞争大会 要讨论“可证可信”TID质量竞争大会一直关注软件质量、工程效能、测试技术和企业级质量体系建设。过去几年测试行业的关键词更多是自动化测试测试平台持续集成DevOps质量左移精准测试智能化测试但到了大模型时代质量领域正在出现一个新的问题效率提升之后可信度怎么保证AI 可以帮我们生成需求分析、测试用例、自动化脚本和测试报告。但生成得快不等于生成得准。看起来完整不等于真的覆盖。语言表达专业不等于结论可信。这也是为什么在 TID质量竞争大会 这样关注质量竞争力和工程实践的场合“可证可信”会成为一个非常值得讨论的话题。因为企业真正需要的不只是“AI 帮我写了一堆测试内容”而是测试依据能不能追溯测试设计能不能解释测试覆盖能不能证明测试执行能不能留证测试结论能不能复核质量风险能不能被提前识别这背后其实是软件测试从“效率工具”走向“可信工程”的关键转折。二、大模型不是测试银弹它更像一个强大的“生成引擎”很多团队刚开始做 AI 测试时都会从一个很直接的场景切入输入需求文档让大模型生成测试用例。这个方向当然有价值。因为过去测试人员写用例确实需要大量时间做需求理解、场景拆解、边界分析和用例编写。大模型可以明显提升这部分效率。但问题也出在这里。如果我们把测试理解成“把需求改写成用例”那么大模型确实很强。但如果我们把测试理解成“发现风险、验证规则、支撑质量决策”那么纯大模型方案就远远不够。真正高质量的测试设计至少需要三类能力。第一类是全面解。也就是从业务流程、角色权限、数据状态、系统交互等多个维度尽可能完整地覆盖正常路径和核心场景。第二类是边界解。也就是识别输入边界、状态边界、权限边界、时间边界、容量边界和流程边界找到最容易出问题的位置。第三类是反向解。也就是不只是证明系统“能工作”还要验证系统在异常输入、非法操作、冲突状态、失败依赖、极端条件下是否仍然可控。而大模型天然更擅长的是生成“常规解”。它可以根据已有语义快速推断出一批高频、常见、合理的测试内容。但对于深层边界、复杂约束、跨系统状态、领域规则冲突大模型并不天然可靠。这就决定了一个现实AI 可以提升测试生产效率但不能单独承担可信测试的全部责任。三、大模型时代测试的核心矛盾变了过去测试团队最关注的问题往往是资源不够、时间不够、执行不够快。所以大家持续建设自动化测试、测试平台、持续集成、质量门禁本质上都是为了提高效率和覆盖率。但大模型进入研发流程之后矛盾开始变化了。因为“生成内容”这件事正在变得越来越容易。难的是生成之后怎么办。比如AI 生成的测试用例谁来判断是否完整AI 生成的测试脚本谁来判断是否可靠AI 总结的测试报告谁来判断是否真实AI 给出的质量结论谁来承担最终责任如果线上出问题能不能反推出当时测试为什么放行这也是杨长春在本次 TID质量竞争大会 分享中想要重点讨论的问题大模型时代测试不能只追求“自动生成”更要追求“可追溯、可解释、可复核”。否则AI 测试很容易从“提效工具”变成“风险放大器”。它可能让我们更快地产出大量测试内容但同时也可能让团队更难判断这些内容到底靠不靠谱。四、可信测试需要从“内容生成”走向“证据闭环”如果把大模型用于测试只停留在生成用例、生成脚本、生成报告价值仍然是有限的。真正面向企业级复杂系统的测试能力需要形成一个完整闭环这个闭环的关键不是让 AI “多生成一点内容”而是让每一个测试结论都有来源、有依据、有过程、有证据。也就是说测试不再只是输出一份报告而是要能回答这个结论基于哪些需求这些需求对应哪些业务规则规则被映射成了哪些测试模型模型生成了哪些用例用例是否被真实执行执行结果是否有证据留存失败、跳过、异常是否可以被复核当测试过程可以被追溯、被解释、被复核测试结论才真正具备可信基础。这也是“可证可信测试”和普通 AI 生成测试之间最大的区别。普通 AI 生成测试更关注“生成了什么”。可证可信测试更关注“为什么这样测、是否真的测过、结论是否站得住”。五、“大模型 知识图谱 模型驱动测试 神经符号验证”为什么重要在本次 TID质量竞争大会 的分享中杨长春将介绍一种更适合企业级复杂系统的融合路径大模型 知识图谱 模型驱动测试 神经符号验证。这套方法并不是简单地把所有问题都交给大模型而是让不同技术承担不同角色。大模型负责理解与生成。知识图谱负责沉淀业务实体、关系、规则和上下文。模型驱动测试负责把业务流程、状态变化和规则约束转化为可执行、可推导、可验证的测试设计。神经符号验证则进一步补足大模型在严谨性、约束推理和结论校验上的不足。可以简单理解为能力模块主要作用解决的问题大模型需求理解、内容生成、用例补全、报告辅助提升生产效率知识图谱业务实体、关系、规则、上下文沉淀避免只靠文本语义理解模型驱动测试流程建模、状态建模、路径生成系统性覆盖正常、异常、边界场景神经符号验证规则约束、逻辑校验、结论复核提升测试结论可信度人类专家风险判断、业务裁决、质量责任确认处理复杂决策与最终责任这套方法的价值在于它没有把所有问题都简单丢给大模型而是把不同技术放在更合适的位置上。大模型解决效率问题。知识图谱解决业务认知问题。模型驱动测试解决覆盖系统性问题。神经符号验证解决逻辑可信问题。人类专家解决复杂判断和责任边界问题。这比单纯喊“AI 自动生成测试用例”更接近企业真实落地。六、为什么复杂系统更需要“可证可信”在简单业务里AI 生成测试用例可能已经能解决不少效率问题。但在复杂业务系统里情况完全不同。比如通信系统往往涉及大量状态流转、协议约束、链路依赖和异常恢复。金融系统往往涉及账户、资金、风控、权限、审计和合规。能源系统往往涉及设备状态、调度逻辑、安全阈值和生产连续性。这些系统的共同特点是业务链路长规则约束多异常场景复杂数据状态变化频繁系统之间强依赖出错后的影响范围大在这类场景里测试不只是验证功能按钮能不能点通而是要验证整个系统在复杂规则下是否稳定、可靠、可控。如果测试依赖纯大模型生成很容易出现三个问题。第一覆盖不完整。大模型可能生成了常见场景却漏掉低频但高风险的边界条件。第二规则不严谨。业务规则之间可能存在隐含约束大模型不一定能稳定识别。第三结论不可追溯。当测试报告只是由 AI 总结出来但缺少模型、规则、执行证据支撑时很难经得起复核。所以越是复杂系统越不能只追求“生成得快”而是要追求“验证得准、过程可追、结论可信”。这也是 TID质量竞争大会 讨论这类议题的价值所在它不是停留在工具层面的“AI 测试用例生成”而是进一步回到企业级质量工程的底层问题。七、人的角色不会消失但会被重新定义大模型进入测试领域之后一个常见问题是测试人员会不会被 AI 替代如果只是做重复性的测试内容编写、简单脚本生成、基础报告整理这些工作确实会被快速自动化。但在可信测试体系里人的价值反而会更加突出。因为 AI 可以帮助生成内容但不能天然承担质量责任。人的角色会从“手工执行者”逐步转向业务风险识别者测试模型设计者规则体系建设者测试结论复核者质量可信体系负责人也就是说测试人员未来的核心竞争力不再只是“会不会写用例、会不会点系统、会不会写脚本”而是能不能把业务规则、风险模型、测试策略和工程工具组织起来形成一套可持续运行的质量保障体系。这也是测试能力向更广义复杂系统验证能力演进的重要方向。八、这场 TID质量竞争大会 分享适合哪些人听如果你正在关注 AI 测试、智能化测试平台、企业级质量工程、模型驱动测试、测试可信度建设这场分享非常值得关注。尤其适合以下几类人测试负责人、质量负责人、测试架构师测试开发工程师、自动化测试工程师正在建设 AI 测试平台的技术团队关注大模型落地质量风险的研发管理者从传统测试向 AI 测试、智能化测试转型的从业者通信、金融、能源、政企等复杂业务系统质量保障团队这场分享不是简单介绍一个 AI 工具也不是停留在“AI 生成用例”的浅层应用而是会进一步讨论AI 生成的测试内容如何可信测试过程如何留证测试结论如何复核复杂系统如何构建可追溯、可解释、可验证的质量闭环测试人员在 AI 时代如何重新定位自己的价值对于正在做质量平台、智能化测试、测试开发转型的团队来说这类议题会非常有启发。九、讲师介绍杨长春北京正元智晟科技有限公司 CEO。曾任 HPE慧与中国高级系统架构师长期从事企业级软件架构、低代码平台、自动化测试与工程效能平台建设拥有相关技术专利及社区分享经历。他曾担任多个大型项目负责人或首席架构师包括中国移动低代码开发平台总集首席架构师、HPE BBOSS 项目首席架构师等并在通信、金融、能源等行业积累了丰富的架构设计与项目实践经验。代表项目包括中信银行 IT 战略咨询等。当前杨长春重点关注大模型时代的软件质量可信问题长期研究测试能力如何从传统功能验证进一步走向复杂系统的可信验证。十、真正的 AI 测试不是让 AI 替你“写一堆用例”很多团队今天谈 AI 测试还停留在“输入需求生成用例”的阶段。这当然有价值但远远不够。因为测试的本质不是生产文档而是发现风险、验证规则、支撑决策。大模型可以让测试内容生产更快但如果没有规则、模型、证据和复核机制再漂亮的测试报告也可能只是“看起来很完整”。大模型时代软件测试真正要解决的问题是让测试结论经得起追问为什么这么测依据是什么有没有覆盖关键风险执行证据在哪里结论能不能被复核这才是“可证可信”背后的真正价值。当 AI 编码、AI 生成、AI 自动化越来越普及软件质量保障也必须从“经验驱动”走向“模型驱动”从“结果汇报”走向“证据闭环”从“测试执行”走向“可信验证”。这可能也是未来几年测试从业者最值得关注的一条主线。而这次 TID质量竞争大会 上关于“大模型时代软件测试如何做到可证可信”的分享正好把这个问题摆到了台前AI 可以让测试更快但真正决定质量竞争力的是测试结论能不能被证明可信。重磅福利购票即赠VIP课程为回馈广大参会者凡从霍格沃兹测试开发学社渠道购买TiD2026质量竞争力大会门票即可免费获得学社人工智能测试开发训练营VIP课程录播体系化学习AI测试开发、大模型评测、智能体测试等前沿内容让大会的每一分钟都持续增值
延伸阅读

更多相关文章

2026/9/19 15:35:57

基于Kimi Agent与Canvas的智能吞噬游戏开发实战

1. 项目概述与核心思路最近在捣鼓一些轻量级的游戏原型,想试试看把AI智能体(Agent)和传统的网页游戏开发结合起来能玩出什么新花样。正好看到Kimi 2.5 Agent的发布,它强调的“技能”和“集群”概念让我觉得,用它来驱动…

2026/9/18 18:11:13

TLP241A光隔离固态继电器与PIC18F4525微控制器的应用方案

1. 项目背景与核心价值 在工业控制和电力电子系统中,电气隔离是确保系统可靠性的关键技术。TLP241A光隔离固态继电器与PIC18F4525微控制器的组合,为解决高压侧与低压侧之间的安全隔离提供了理想方案。这种设计能有效防止地环路干扰、抑制共模噪声&#x…

2026/9/19 20:33:02

电容/电感元件VCR与串并联:3种等效计算对比,避免电路分析混淆

电容与电感元件VCR及串并联计算:3种等效方法对比与典型误区解析在电路设计与分析中,电容和电感作为核心动态元件,其伏安关系(VCR)与串并联等效计算是构建复杂电路模型的基础。许多工程师在从理论学习转向实际应用时,常因混淆两类元…

2026/9/20 9:35:18

OpenResearch:本地优先研究协议与CLI工程实践

1. OpenResearch 不是又一个 CLI 工具,而是本地优先研究工作流的底层协议OpenResearch 这个名字乍看像某个开源项目仓库名,或是某家科技公司的内部代号。但结合近期全网爆发式增长的搜索热词——尤其是CLI、orx、autoresearch、local-first这四个关键词高…

2026/9/20 9:35:18

C语言结构体内存对齐与实战应用全解析

1. 为什么结构体是C语言里最值得花时间啃透的“硬骨头”你刚学完数组,发现它只能存同类型数据;刚搞懂指针,发现它像一把万能钥匙却总打不开复杂数据的大门;写到文件读写时,一行行fscanf读整数、字符、浮点数&#xff0…

2026/9/20 9:35:18

uni-app 鸿蒙 UTS 插件开发:UTSHarmony 内置 API 完全指南

uni-app 鸿蒙 UTS 插件开发:UTSHarmony 内置 API 完全指南 【免费下载链接】uni-app A cross-platform framework using Vue.js 项目地址: https://gitcode.com/gh_mirrors/un/uni-app 导读:UTSHarmony 是 uni-app 在 HarmonyOS 平台为 UTS 插件作…

2026/9/20 9:35:18

微信小程序投票系统:三层防重+JWT权限+实时统计实战

简介:这是一套面向计算机专业本科生的微信小程序毕业设计实战项目,完整实现了一个B/S架构的投票评选系统,适用于课程设计、毕设选题与全栈开发能力训练。资源包含可直接运行的前后端源码、详细开发说明文档、MySQL数据库脚本及配套演示视频&a…

2026/9/20 9:35:18

Python开发避坑指南:常见错误与解决方案

1. 为什么Python开发者需要避坑指南刚入行那会儿,我总在深夜对着报错信息抓狂。明明照着教程写的代码,偏偏抛出各种莫名其妙的错误。后来才发现,Python虽然以易学着称,但隐藏的"坑"比想象中多得多。有些错误会直接导致程…

2026/9/20 9:30:17

百万芯片互联背后:TPU集群的系统级工程与电力瓶颈

一百万个芯片塞进一个集群,听起来像是PPT上的数字游戏,但谷歌这次把TPU互联架构推到100万芯片规模,实际上是把AI基础设施的竞争从“单卡算力赛道”拉到了“系统级工程赛道”。我做大规模训练平台这些年,最大的感受是:越…

2026/9/20 0:04:49

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/20 0:04:49

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/20 0:04:49

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/20 0:04:49

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/20 4:54:47

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/20 5:01:23

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/20 5:09:33

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码