[Agent的评估-03]利用LocalEvaluator自定义逻辑评估MAF Agent

发布时间:2026/9/14 20:14:53

[Agent的评估-03]利用LocalEvaluator自定义逻辑评估MAF Agent MAF的Agent评估体系以IAgentEvaluator为核心作为该接口的三个原生实现之一LocalEvaluator运行我们在本地定义符合签名的委托来对AIAgent实施评估。原则上我们可利用这种方式实现任意评估逻辑。我们就来看看LocalEvaluator背后是如何驱动我们自定义的委托来评估指定的Agent。1. EvalCheck委托上述的用于评估Agent的委托类型为具有如下定义的EvalCheck。它的输入类型EvalItem是构成MAF Agent评估体系的三大核心元素之一实施评估所需的所有信息都包括其中在Agent的评估-02:MAF Agent评估系统三个核心要素中我们已经对这个类型进行了深入介绍这里就不再赘言了。publicdelegateEvalCheckResultEvalCheck(EvalItemitem);publicsealedrecordEvalCheckResult(boolPassed,stringReason,stringCheckName);利用EvalCheck实施评估的结果体现再返回的EvalCheckResult对象上这个记录类型包含如下三个属性Passed 评估是否通过Reason评估通过与否的原因CheckName 当前评估的名称一般用于简单描述进行哪方面的评估。2. EvalCheckResult向EvaluationMetric的转换通过Agent的评估-02:MAF Agent评估系统三个核心要素的介绍我们知道MAF的Agent评估体系利用AgentEvaluationResults来表示评估的结果具体针对某项指标的评估结果通过EvaluationMetric类型表示。作为EvalCheck委托评估结果的EvalCheckResult最终需要转换成EvaluationMetric对象并添加到EvaluationResult的Metrics字典中。staticEvaluationMetricConvert(EvalCheckResultevalCheckResult)newBooleanMetric(evalCheckResult.CheckName,evalCheckResult.Passed,evalCheckResult.Reason){InterpretationnewEvaluationMetricInterpretation{Rating(evalCheckResult.Passed?EvaluationRating.Good:EvaluationRating.Unacceptable),Failed!evalCheckResult.Passed}};上面定义的这个Convert方法基本上体现了EvalCheckResult向EvaluationMetric的转换规则。由于EvalCheckResult只能体现是否通过评估所有最终转换生成的是一个评估指标值类型为布尔类型的BooleanMetric对象EvalCheckResult对象的CheckName、Passed和Reason分别对应BooleanMetric的Name、Value和Reason属性。与此同时还会为BooleanMetric对象的Interpretation属性设置一个EvaluationMetricInterpretation对象对评估结果作进一步解释具体来说后者的两个属性会按照如下的规则进行设置Rating 如果EvalCheckResult的Passed属性为true返回EvaluationRating.Good否则返回EvaluationRating.UnacceptableFailedEvalCheckResult的Passed属性取反3. LocalEvaluator的评估流程如下所示的是LocalEvaluator类型的完整定义。可以看出它是对一组EvalCheck对象的封装Name属性固定返回LocalEvaluator实现的EvaluateAsync会将evalName参数默认设置为Local EvalpublicsealedclassLocalEvaluator:IAgentEvaluator{privatereadonlyEvalCheck[]_checks;publicstringNameLocalEvaluator;publicLocalEvaluator(paramsEvalCheck[]checks)_checkschecks;publicTaskAgentEvaluationResultsEvaluateAsync(IReadOnlyListEvalItemitems,stringevalNameLocal Eval,CancellationTokencancellationTokendefault(CancellationToken)){ListEvaluationResultlistnewListEvaluationResult(items.Count);foreach(EvalItemiteminitems){cancellationToken.ThrowIfCancellationRequested();EvaluationResultevaluationResultnewEvaluationResult();EvalCheck[]checks_checks;foreach(EvalCheckevalCheckinchecks){EvalCheckResultevalCheckResultevalCheck(item);evaluationResult.Metrics[evalCheckResult.CheckName]newBooleanMetric(evalCheckResult.CheckName,evalCheckResult.Passed,evalCheckResult.Reason){InterpretationnewEvaluationMetricInterpretation{Rating(evalCheckResult.Passed?EvaluationRating.Good:EvaluationRating.Unacceptable),Failed!evalCheckResult.Passed}};}list.Add(evaluationResult);}returnTask.FromResult(newAgentEvaluationResults(Name,list,items));}}实现在EvaluateAsync方法中的评估逻辑很简单遍历每个EvalItem并为之创建一个EvaluationResult对象后者Metrics属性填充的EvaluationMetric由对应的EvalCheckResult根据上述的规则转换而成。至于EvalCheckResult自然就是每个EvalCheck针对EvalItem实施评估的结果。4. 预定义EvalCheckMicrosoft.Agents.AI.EvalChecks类型利用定义的一系列静态方法创建了对应的EvalCheck委托我们可以直接拿来用。4.1 关键字验证EvalChecks利用如下所示的两个重载的KeywordCheck方法返回的EvalCheck用来验证Agent的响应文本是否包含指定的关键字。如代码所示我们可以利用caseSensitive参数控制字符串比较是否考虑大小写默认为大小写不敏感。只有响应文本包含所有指定的关键字才算是评估通过。publicstaticclassEvalChecks{publicstaticEvalCheckKeywordCheck(paramsstring[]keywords);publicstaticEvalCheckKeywordCheck(boolcaseSensitive,paramsstring[]keywords);}如果评估通过返回EvalCheckResult的Reason属性会说明所有的执行的关键字依次列出均已找到否则会列出缺失的关键字。EvalCheckResult的Name固定返回keyword_check。4.2 工具调用验证如果需要评估规则要求指定的工具集必须被调用则可以利用如下两个ToolCalledCheck方法重载mode参数表示的ToolCalledMode枚举提供了两个选项表示是要求指定的工具全部被调用还是说只需要其中有一个被调用就行默认为前者。具体验证的工具名称列表通过toolNames参数指定。publicstaticclassEvalChecks{publicstaticEvalCheckToolCalledCheck(paramsstring[]toolNames);publicstaticEvalCheckToolCalledCheck(ToolCalledModemode,paramsstring[]toolNames);}publicenumToolCalledMode{All,Any,}我们知道利用提供的对话历史提取调用过的工具只需要从消息的Contents属性中提取FunctionCallContent类型的内容就可以了所以ToolCalledCheck方法会采用这种方式提取调用过的工具名称列表。作为验证结果的EvalCheckResul以tool_called_check命名。如果不要求调用具体某个工具只要求有过工具调用就行。比如只注册了一个工具或者注册的工具具有很大的差异不太可能选错此时只需要有工具被调用就可以。这种情况可以使用如下这个ToolCallsPresent方法生成的EvalCheck委托。作为验证结果的EvalCheckResul以tool_calls_present命名。publicstaticclassEvalChecks{publicstaticEvalCheckToolCallsPresent();}通过Agent的评估-02:MAF Agent评估系统三个核心要素对EvalItem类型的介绍我们知道该类型定义了一个ExpectedToolCalls属性返回一组ExpectedToolCall对象用来设置希望LLM生成的工具调用。ExpectedToolCall不仅定义了希望调用的工具名名称还定义以希望传入的参数列表。如果需要进行这样的评估可以使用ToolCallArgsMatch方法返回的EvalCheck委托。作为验证结果的EvalCheckResul以tool_call_args_match命名。publicsealedclassEvalItem{publicIReadOnlyListExpectedToolCall?ExpectedToolCalls{get;set;}}publicrecordExpectedToolCall(stringName,IReadOnlyDictionarystring,object?Argumentsnull);publicstaticclassEvalChecks{publicstaticEvalCheckToolCallArgsMatch();}4.3 响应文本长度的验证如果不希望响应文本为空或者过短可以使用如下这个NonEmpty方法返回的EvalCheck委托参数minLength表示响应文本允许的最短长度。作为验证结果的EvalCheckResul以non_empty命名。publicstaticclassEvalChecks{publicstaticEvalCheckNonEmpty(intminLength1)}4.4 希望输出内容验证除了表示希望工具调用的ExpectedToolCalls属性EvalItem还定义了如下这个用来表示希望响应文本中包含的输出内容。如果希望完成对用的评估可以使用如下这个ContainsExpected方法返回的EvalCheck委托参数caseSensitive表示在进行字符串比较中是否考虑大小写默认为大小写不敏感。作为验证结果的EvalCheckResul以contains_expected命名。publicsealedclassEvalItem{publicstring?ExpectedOutput{get;set;}}publicstaticclassEvalChecks{publicstaticEvalCheckContainsExpected(boolcaseSensitivefalse)}4.4 多媒体内容验证在一些针对图像处理的应用场景中有时候要求对话历史中必须包含具有图片内容的消息这是可以使用HasImageContent方法生成的EvalCheck。因为EvalItem的HasImageContent属性对此做出判断所以评估是否通过完全取决于此属性的值。作为验证结果的EvalCheckResul以has_image_content命名。publicsealedclassEvalItem{publicboolHasImageContentthis.Conversation.Any(mm.Contents.Any(c(cisDataContentdcdc.HasTopLevelMediaType(image))||(cisUriContentucuc.HasTopLevelMediaType(image))));}publicstaticclassEvalChecks{publicstaticEvalCheckHasImageContent()}5. 实例演示下面的程序演示一个相对完整的例子。如代码所示我们为创建的Agent注册了两个工具函数GetLocationCode 根据城市名车查询位置代码GetWeather 根据城市位置代码获取实时天气。在调用Agent的EvaluateAsync扩展方法进行评估时我们使用了LocalEvaluator作为唯一的评估器 并指定了通过调用ContainsExpected、ToolCallArgsMatch、ToolCalledCheck和KeywordCheck方法创建的四个EvalCheck委托我们使用它们对工具调用和输出的内容进行评估。与ContainsExpected和ToolCallArgsMatch配套我们还指定了expectedOutput和expectedToolCalls两个参数。usingAzure.AI.Projects;usingDotNetEnv;usingMicrosoft.Agents.AI;usingMicrosoft.Extensions.AI;usingMicrosoft.Extensions.AI.Evaluation;usingOpenAI;usingSystem.ClientModel;usingSystem.ComponentModel;usingSystem.Text.Encodings.Web;usingSystem.Text.Json;usingSystem.Text.Json.Serialization;Env.Load();varapiKeyEnvironment.GetEnvironmentVariable(OPENAI_API_KEY)!;varendpointEnvironment.GetEnvironmentVariable(OPENAI_BASE_URL)!;ListAITooltools[AIFunctionFactory.Create(GetLocationCode,nameof(GetLocationCode)),AIFunctionFactory.Create(GetWeather,nameof(GetWeather))];varagentnewOpenAIClient(newApiKeyCredential(apiKey),newOpenAIClientOptions{EndpointnewUri(endpoint)}).GetChatClient(model:gpt-5.4-mini).AsIChatClient().AsAIAgent(tools:tools);varresultsawaitagent.EvaluateAsync(queries:[目前苏州天气如何?],evaluator:newLocalEvaluator(EvalChecks.ToolCallArgsMatch(),EvalChecks.ToolCalledCheck(nameof(GetLocationCode),nameof(GetWeather)),EvalChecks.KeywordCheck(晴,25)),expectedOutput:[晴],expectedToolCalls:[[newExpectedToolCall(nameof(GetLocationCode),newDictionarystring,object{{city,苏州}}),newExpectedToolCall(nameof(GetWeather),newDictionarystring,object{{locationCode,123456}})]]);varserializerOptionsnewJsonSerializerOptions{WriteIndentedtrue,EncoderJavaScriptEncoder.UnsafeRelaxedJsonEscaping};serializerOptions.Converters.Add(newJsonStringEnumConverter());Console.WriteLine(JsonSerializer.Serialize(results.Items.Single().Metrics,serializerOptions));[Description(获取所在城市的位置代码)]staticstringGetLocationCode([Description(城市名称)]stringcity)123456;[Description(获取所在城市的实时天气)]staticstringGetWeather([Description(城市位置代码)]stringlocationCode)晴气温25摄氏度;我只输出包含在验证结果中最核心的评估指标。从如下的输出内容可看出与指定的四个EvalCheck委托对应的评估指标全部通过。{contains_expected:{$type:boolean,Value:true,Name:contains_expected,Reason:Response contains expected output: \晴\,Interpretation:{Rating:Good,Failed:false,Reason:null},Context:null,Diagnostics:null,Metadata:null},tool_call_args_match:{$type:boolean,Value:true,Name:tool_call_args_match,Reason:Tool call args match: 2/2\n GetLocationCode: args match\n GetWeather: args match,Interpretation:{Rating:Good,Failed:false,Reason:null},Context:null,Diagnostics:null,Metadata:null},tool_called_check:{$type:boolean,Value:true,Name:tool_called_check,Reason:All tools called: GetLocationCode, GetWeather,Interpretation:{Rating:Good,Failed:false,Reason:null},Context:null,Diagnostics:null,Metadata:null},keyword_check:{$type:boolean,Value:true,Name:keyword_check,Reason:All keywords found: 晴, 25,Interpretation:{Rating:Good,Failed:false,Reason:null},Context:null,Diagnostics:null,Metadata:null}}
延伸阅读

更多相关文章

2026/9/14 15:26:07

Switch手柄PC连接终极方案:BetterJoy完整使用指南

Switch手柄PC连接终极方案:BetterJoy完整使用指南 【免费下载链接】BetterJoy Allows the Nintendo Switch Pro Controller, Joycons and SNES controller to be used with CEMU, Citra, Dolphin, Yuzu and as generic XInput 项目地址: https://gitcode.com/gh_m…

2026/9/14 15:26:05

XXD新西达黄皮30A电调驱动无刷电机A2212-STM32F103C8T6驱动-航模DIY

一、作者的话在家无聊,买了些材料,想自己DIY一个航模飞机,算是实现小时候的梦想。PS:现在论坛上水的博客很多,我发这篇文章也是希望有和我志同道合的朋友少走些弯路。DIY航模全套资料和成品代码评论我可以发给你。电调的三根线接无…

2026/9/15 19:58:30

dotnet/skills升级插件六大技能清单:.NET版本升级路线图

dotnet/skills升级插件六大技能清单:.NET版本升级路线图 【免费下载链接】skills Repository for skills to assist AI coding agents with .NET and C# 项目地址: https://gitcode.com/GitHub_Trending/skills17/skills 对于正在维护 .NET 项目的开发者来说…

2026/9/15 19:58:30

Reactive Resume 简历导出指南:四格式下载与避坑

Reactive Resume 简历导出指南:四格式下载与避坑 【免费下载链接】reactive-resume A one-of-a-kind resume builder that keeps your privacy in mind. Completely secure, customizable, portable, open-source and free forever. Try it out today! 项目地址: …

2026/9/15 19:58:30

Keil 5安装教程:C51与MDK共存完整指南

作为一个常年跟单片机打交道的人,我太清楚Keil这个开发环境的脾气了。很多刚入门的朋友下载了安装包,一路狂点下一步,结果要编译51单片机程序时发现编译器不对,等要搞STM32时又发现设备支持包缺失,最后只能在知乎和CSD…

2026/9/15 19:53:30

大模型核心技术解析:5个关键概念与应用实践

1. 大模型入门:为什么这5个概念如此重要?最近两年,大模型技术以惊人的速度渗透到各个领域。作为一名长期跟踪AI技术发展的从业者,我经常被问到:"大模型到底是什么?为什么它突然变得这么重要&#xff1…

2026/9/15 4:54:30

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/15 0:01:16

AI英语单词APP开发:自适应学习算法与移动端优化实践

1. 项目概述 作为一名在移动应用开发领域摸爬滚打多年的老手,我最近完成了一个AI英语单词APP的开发项目。这个项目将传统单词记忆方法与现代AI技术相结合,打造了一款能够智能适应不同用户学习习惯的英语学习工具。 市面上大多数单词APP都存在一个通病&a…

2026/9/15 0:01:16

Flutter与OpenHarmony结合开发手语学习APP实战

1. 项目背景与核心价值作为一名同时接触过Flutter和OpenHarmony的开发者,最近我完成了一个基于Flutter for OpenHarmony的手语学习APP实战项目。这个项目最大的特点在于实现了跨平台框架与国产操作系统深度结合的创新实践——用Flutter开发的应用能完美运行在OpenHa…

2026/9/15 0:01:16

六个月成为机器人工程师:从ROS2到SLAM的实战路径

1. 六个月的紧迫感从哪来:先搞清楚你要成为哪种机器人工程师说实话,六个月的期限并不是一个宽松的时间线。市面上任何一本正经的机器人学教材都超过五百页,ROS2的官方文档可以翻到你怀疑人生,再加上ABB、KUKA这些工业机器人厂家动…

2026/9/15 14:22:53

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/14 13:53:59

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/15 11:42:23

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码