发布时间:2026/8/29 12:27:16
智能体开发:利用大模型做应用效果评估 利用大语言模型来评估文本质量是当下最前沿的创新评估手段。其核心原理在于先通过一个大语言模型生成文本内容随后利用另一个大语言模型或由同一模型对该文本进行质量评价。接下来让我们看看《AI原生应用开发提示工程原理与实战》一书中提到的4种利用大语言模型进行评估的方法。1.一致性评估这种方法通过判断生成答案内容与标准答案是否一致性来评估是一种简单直接的评估方式。然而这种方法取决于人工提前已经标注好了标准答案如下面这个例子。# 任务描述 作为一名测试评估专家请评估以下“答案内容”与“标准答案”是否一致。 # 答案内容 地球是太阳系中的第三颗行星以其丰富的水资源和多样的生命形式而闻名。 # 标准答案 地球位于太阳系的第三轨道上是唯一已知拥有生命的星球其表面有大量的水。 # 评估结论 评估结论一致/基本一致/不一致 评估依据输出结果评估结论基本一致 评估依据答案和标准答案都指出了地球在太阳系中的位置第三或第三轨道上都提到了地球拥有丰富的水资源答案中提到的“丰富的水资源”与标准答案中的“表面有大量的水”相对应以及地球与生命有关答案中的“多样的生命形式”与标准答案中的“唯一已知拥有生命的星球”相呼应。尽管两者在表述上有所不同但它们所传达的核心信息是相似的因此可以认为两者基本一致。不过答案中并未明确指出地球是“唯一”已知拥有生命的星球这是与标准答案的一个细微差别但这个差别不足以改变两者基本一致的结论。2. 关键点覆盖评估这种评估方法关注的是大语言模型生成的答案是否覆盖了给定的评估关键点。通过对比答案内容和评估关键点可以判断答案的完整性和准确性。例如以下是一个评估示例。# 任务描述 作为一名测试评估专家请你细阅以下“提问”和“答案内容”评估“答案内容”是否覆盖“答案关键点”。 # 提问 描述一下太阳能板的工作原理及其对环境的好处。 # 答案内容 太阳能板通过其表面的光伏细胞将太阳光转换为电能。这些细胞是由半导体材料制成当太阳光照射到这些细胞上时就会激发电子从而产生电流。太阳能板的使用可以减少对化石燃料的依赖从而减少温室气体排放和空气污染对抗气候变化有积极作用。 # 答案关键点 关键点1答案需要提到光伏细胞的作用。 关键点2答案需要提到能量转换过程。 # 输出格式 关键点x: 覆盖/部分覆盖/未覆盖理由 # 评估结论 -输出结果关键点1: 覆盖理由是答案内容中明确提到了光伏细胞将太阳光转换为电能的作用这些细胞由半导体材料制成能够激发电子产生电流。 关键点2: 覆盖理由是答案内容中描述了能量转换过程即太阳光照射到光伏细胞上激发电子从而产生电流。3.答案对比评估该方法是通过对比不同版本的生成答案来进行评估的其主要目的是判断当前版本答案是不是比之前一个版本更好。为了满足评估的需求我们既可以制定清晰的评判标准也可以借助大语言模型自身所具备的自主判断力如下面这个例子。# 任务描述 作为一名测试评估专家请你细阅以下两段答案并评估哪一段文本的表述更为出色。 # 提问 描述一下熊猫的特点和它们与中国的关系。 # 答案1 熊猫是一种非常可爱的动物它们的毛色是黑白相间的它们的眼睛也是黑白相间的它们的鼻子也是黑白相间的它们的耳朵也是黑白相间的它们的尾巴也是黑白相间的它们的脚掌也是黑白相间的它们的肚子也是黑白相间的它们的背部也是黑白相间的。它们喜欢吃竹子竹子是一种非常好吃的植物它们有很多竹节竹节里面有很多水分和营养熊猫每天要吃很多竹子才能保持健康和活力。熊猫是中国的国宝中国人非常喜欢熊猫熊猫也非常喜欢中国人它们和中国人有着深厚的感情和友谊。 # 答案2 熊猫是一种极为可爱的动物其毛色独特黑白相间这种鲜明的色彩对比同样体现在它们的眼睛、鼻子、耳朵、尾巴、脚掌、肚子以及背部。它们对竹子情有独钟这种植物不仅美味而且富含水分和营养熊猫每日需大量摄取以保持健康和活力。作为中国的国宝熊猫深受国人喜爱而它们也同样对中国人怀有深厚的感情彼此间建立了牢固的友谊。 # 评估结论 更出色的答案是答案x 理由是输出结果更出色的是答案2 理由是答案2的表述更为简洁且流畅。相较于答案1中多次重复“黑白相间”的描述答案2通过一句“其毛色独特黑白相间这种鲜明的色彩对比同样体现在它们的眼睛、鼻子、耳朵、尾巴、脚掌、肚子以及背部”进行了有效的整合避免了冗余。同时答案2在描述熊猫与中国的关系时语言也更为精炼和富有感情使得整体阅读体验更佳。4.多维度打分评估多维度打分是一种全面的评估方法他依靠大语言模型自有的评估和推理能力从多个角度对文本进行评估如准确性、完整性、拟人性、易懂性等。这种方法需要明确每个维度的具体标准如下面这个例子。# 任务描述 作为一名测试评估专家请你参照以下评估准则对客服回复话术进行全面的质量评价。每个评价指标都将分为三个等级满意/一般/不满意具体的评估标准如下所示。 # 评估标准 准确性话术是否准确回答了用户的问题或解决了用户的疑惑。 完整性答案是否涵盖了问题的所有关键方面提供了用户需要的所有信息。 拟人性答案是否符合人设包括语言风格、工作情境思维模式。 易懂性答案是否使用了清晰、简洁的语言答案的组织是否有条理便于用户理解。 # 客户提问 如何在APP开电子发票 # 回复内容 尊敬的用户您好。针对您提出的在我们的APP中申请电子发票的流程以下是您需要遵循的步骤首先启动应用程序并导航至“账单概览”区域。在此您将找到一个名为“账单处理中心”的选项点击进入后系统会展示一系列可供开票的账单记录。选择相应记录后点击界面下方的“发票生成器”按钮进入下一阶段。此时您需要在“电子邮件传输节点”处输入您的邮箱信息以便我们将生成的电子发票通过“数据传输协议”发送至您的邮箱。在整个过程中如果您遇到任何技术性障碍或操作疑问我们的“客户支持枢纽”随时待命为您提供专业的解答与支持。请记得我们的目标是确保您的体验尽可能地顺畅无阻。 # 评估结果 -输出结果准确性满意话术详细且准确地回答了用户如何在APP中申请电子发票的问题 完整性满意话术完整地介绍了在APP中申请电子发票的所有关键步骤 拟人性一般虽然话术提供了详尽的步骤但使用了较为正式和技术性的语言可能给用户带来一定距离感与日常交流的语言风格有一定差异 易懂性一般虽然话术详细介绍了操作步骤但使用了一些技术性的词汇如“电子邮件传输节点”、“数据传输协议”可能对非技术用户来说理解起来有一定难度利用大语言模型进行评估极大地提高了效率降低了人工评估的成本。然而它是否能在准确性和质量上超越人类评估尚无定论这主要受到以下因素的影响主观性大语言模型评估同人类评估一样面临主观性挑战。不同的评估者无论是人类还是模型可能会根据不同的标准或偏好来评判文本质量。模型偏好每个大语言模型在训练后都会形成自己的知识领域和偏好特征。这些特征可能导致模型在评估时产生偏见例如更偏好自己生成的文本或更长的文本。总体而言利用大语言模型进行文本评估是一个充满潜力的方法但仍需进一步研究和改进以提高其准确性和可靠性。5.深入阅读模型效果评估Model Evaluation是AI原生应用落地的一个关键环节。它涉及对训练好的模型进行全面的性能分析和效果评估。通过使用各种评估技术手段和评估指标衡量模型的准确度、可靠性、泛化能力等关键特性从而帮助开发者理解和改进模型确保模型能够满足业务实际需求。为了更深入地了解这一领域我们强烈推荐《AI原生应用开发提示工程原理与实践》一书。该书详尽地探讨了基于大语言模型构建AI原生应用时的评估挑战包括评估指标的选择、评估方法的运用等关键问题。通过阅读此书读者可以获取到关于如何更有效地利用大语言模型进行评估的宝贵洞见。

相关新闻

2026/8/29 12:22:16

MiniMax H3开源视频模型本地部署与ComfyUI实战指南

MiniMax 开源一周,视频模型正在重演 DeepSeek 的故事。如果你关注过 DeepSeek 开源后在本地部署、第三方工具集成、显存优化讨论里反复刷屏的场景,那么这次 MiniMax 把视频生成模型开源,基本是同一套路:先靠开源模型点燃社区热情&…

2026/8/29 12:22:16

OpenAI研究员跳槽谷歌,揭示大模型后训练成AI竞争新焦点

一个研究员的流动,往往比一个模型的发布,更能说明行业到底走到了哪一步。“OpenAI 前研究员巴雷特佐夫重返谷歌,助力 Gemini 研发”这条新闻,看起来只是个人职业选择。但把它放在过去两年多时间里看,它其实把 AI 竞赛的…

2026/8/29 12:22:16

从北邮机试题解析优先队列:复数集合动态排序与自定义比较器实战

1. 项目概述:从一道机试题看数据结构与算法的实战应用 最近在帮几个准备计算机考研复试的同学梳理机试题目,发现牛客网上北邮的历年复试上机题里,有一道关于“复数集合”的题目出镜率相当高。这道题本身并不算复杂,但它巧妙地将数…

2026/8/29 12:37:16

Zernike拟合MATLAB程序集成数据库实战指南

简介:Zernike多项式是光学波前建模与像差分析的基础数学工具,其系数承载着piston、tilt、defocus、astigmatism等关键物理像差信息。理解Zernike拟合原理需从正交基函数构造、归一化约束和(n,m)阶次映射出发;而工程落地的核心挑战在于将离散系…

2026/8/29 12:37:16

tradingview-mcp能做什么、不能做什么:能力与边界完整清单

tradingview-mcp能做什么、不能做什么:能力与边界完整清单 【免费下载链接】tradingview-mcp AI-assisted TradingView chart analysis — connect Claude Code to your TradingView Desktop for personal workflow automation 项目地址: https://gitcode.com/Git…

2026/8/29 12:32:16

柔性机械臂动力学建模与反步控制仿真全解析

简介:在机器人控制领域,柔性机械臂因关节或臂杆弹性变形而呈现复杂的欠驱动特性,其动力学建模与振动抑制是工程实践中的核心难题。与刚性臂不同,柔性臂系统需引入假设模态法离散化无穷维分布参数模型,进而获得包含刚性…

2026/8/28 16:16:17

[光学原理与应用-521]:对光的错误理解与纠偏

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

2026/8/28 16:16:21

SIP通话转接原理与REFER方法实战解析

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

2026/8/28 16:16:22

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

2026/8/29 0:01:10

etc目录下的profile.d文件目录设置环境变量和全局脚本shell

一、设置环境变量etc目录下的profile.d文件目录 /etc/profile.d1、编写 vi test.sh文件内容# jdk变量 export ZHK_HOME/root export PATH$PATH:$ZHK_HOME/test # 可以取出来ZHK_HOME变量给ZZZ_HOME赋值 export ZZZ_HOME${ZHK_HOME}/test2、刷新 执行source /etc/profile 命令使…

2026/8/29 0:01:10

【JavaScript】内存管理-垃圾回收机制-内存泄露

内存管理 C 语言这样的底层语言一般都有底层的内存管理接口,比如 malloc()和free()。 而 JavaScript 是在创建变量(对象,字符串等)时自动进行了分配内存,并且在不使用它们时“自动”释放。释放的过程称为垃圾回收。 整…

2026/8/29 0:01:10

Labgrid-MCP:为嵌入式硬件实验室接入AI Agent操控能力

Labgrid-MCP 的目标是把 MCP(Model Context Protocol)能力延伸到真实嵌入式硬件实验室:AI Agent 通过一个标准化的 MCP Server,就能查看目标板状态、控制上电断电、复位开发板、读取串口日志,甚至执行镜像刷写。对于经…

2026/8/28 16:16:48

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/28 16:16:50

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/28 11:06:45

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…