零成本本地LLM评测:用 DeepEval + Ollama 十分钟跑通离线回归

发布时间:2026/9/9 14:29:29

零成本本地LLM评测:用 DeepEval + Ollama 十分钟跑通离线回归 零成本本地LLM评测用 DeepEval Ollama 十分钟跑通离线回归【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval本文讲如何用 DeepEval 把本地LLM评测完全跑在自己的机器上用 Ollama 或 vLLM 推理服务充当打分模型30 内置指标直接接入回归测试做成普通 pytest 用例挂进 CI。测试数据与模型输出不出机器不产生 API 账单评测速度与成本都由你掌控。上周有个医疗支持团队问能不能让患者对话数据不出内网就完成一次 chatbot 输出的全量质检答案是可以——在 DeepEval 的评测流程里打分的模型同样可以换成你机器上的那一台。整套 DeepEval 本地部署流程核心只是把打分模型替换成本地实例其余代码不动。把打分模型搬到自己机器上的理由评测的本质是让一个模型给另一个模型的输出打分。当评委是云端 API 时每一次打分调用都会把你的测试输入、被测模型输出、参考答案一起发出去。对普通产品迭代这无所谓但医疗、金融这类场景这个数据流本身就是合规风险。成本上更直接100 条测试用例 × 3 个指标就是 300 次评委调用按 token 计费。模型每周迭代一次这笔钱就是长期固定支出。换成本地评测后账单归零你要操心的只剩电费和显存。还有个实用收益不依赖外网结果不受限流和抖动影响同一份数据集每次跑出来的分数可复现。本地模型怎么接进本地LLM评测DeepEval 把打分模型抽象成统一接口接入有三条路从零代码到十几行不等。Ollama 直连。本机装了 Ollama 并拉好模型三行就能用from deepeval.metrics import AnswerRelevancyMetric, FaithfulnessMetric from deepeval.models import OllamaModel judge OllamaModel(modelllama3.1:8b, temperature0) # 指向本机 Ollama 服务 metrics [ AnswerRelevancyMetric(modeljudge), FaithfulnessMetric(modeljudge), ]OllamaModel是 DeepEval 内置适配器默认连http://localhost:11434参数细节见 Ollama 集成文档。用 OpenAI 兼容服务直连本地跑 vLLM、llama.cpp、SGLang 这类推理服务时它们都暴露 OpenAI 兼容接口直接用内置的LocalModelfrom deepeval.models import LocalModel judge LocalModel( modelQwen/Qwen2.5-7B-Instruct, base_urlhttp://localhost:8000/v1, # 本地推理服务地址 )自托管模型写一个 12 行适配器直接用 Transformers 加载的模型继承DeepEvalBaseLLM实现生成方法即可可参考 内置适配器的实现。以 4 位量化的 Llama-3 8B 为例from deepeval.models import DeepEvalBaseLLM class MyLocalJudge(DeepEvalBaseLLM): def __init__(self, model, tokenizer): self.model, self.tokenizer model, tokenizer # 自行加载后传入 def load_model(self): return self.model def generate(self, prompt, schemaNone): out self.model.generate( **self.tokenizer(prompt, return_tensorspt).to(cuda), max_new_tokens200) return self.tokenizer.decode(out[0], skip_special_tokensTrue), 0.0 def get_model_name(self): return local-judge三条路覆盖绝大多数开源模型图省事就选前两条。评测指标怎么选先定维度再挑模型这些开源模型评测指标按检验维度划分且全部支持本地计算。第一次回归从相关性、事实性、安全三条线各挑一个就够维度代表指标检验什么相关性AnswerRelevancy回答是否切题、不跑偏事实性Faithfulness有无编造参考材料之外的事实幻觉安全性Toxicity输出是否带有害、偏见内容格式JSONCorrectness结构化输出能否被解析评委选型是关键1.5B 级别的小模型跑得快但判断本身不稳定分数容易来回漂7B~8B 是常用区间质量与速度平衡。若你的被测模型就是 8B让评委能力不低于它是比较稳妥的选择。显存与速度卡住时怎么办本地跑评测瓶颈通常只有两个显存、吞吐。显存不足时优先 4 位量化8B 模型占用从约 16GB 降到 4GB 左右约降 75%对打几分这种任务的精度影响很小。加载时传入BitsAndBytesConfig(load_in_4bitTrue, bnb_4bit_quant_typenf4)即可。吞吐不足时用 vLLM 这类推理引擎替代裸 Transformers 推理速度通常能提数倍再配合异步生成a_generate把测试集分批并发处理。还有一个常见坑部分开源模型输出 JSON 不稳定导致指标拿不到分数。遇到分数为空的指标先检查评委有没有按要求输出结构化判定——换一个指令遵循更好的模型或在推理服务端加格式约束比改评测代码更直接。把本地LLM评测挂进 CI 回归能本地跑就能被 CI 调度。把评测做成普通 pytest 用例每次提交都跑一遍黄金数据集指标低于阈值直接让构建失败。import pytest from deepeval import assert_test cases load_goldens() # 从本地 JSON 读取黄金数据集 pytest.mark.parametrize(case, cases) def test_no_regression(case): assert_test(test_casecase, metricsmetrics)# 在 .github/workflows/llm-eval.yml 里追加 - name: 本地评测 run: pytest tests/test_llm_quality.py这样 prompt 一改、模型版本一切就有机器替你把关分数漂移当天就能发现。行动清单✅pip install -U deepeval本机装好 Ollama 并拉一个 7B~8B 模型✅ 用OllamaModel替换打分模型先跑相关性 事实性 安全三个核心指标✅ 本地服务是 OpenAI 兼容接口时改用LocalModel并指向 vLLM 的base_url✅ 写一个黄金数据集的 pytest 用例挂进 CI给每个指标设好通过阈值✅ 显存吃紧时先上 4 位量化再考虑换小一号的模型【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/9 14:29:29

旧Mac升级新系统免费完成:OCLP三阶段完整教程

旧Mac升级新系统免费完成:OCLP三阶段完整教程 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 老 Intel Mac 收不到新系统更新,不等于只…

2026/9/9 14:29:29

RF430FRL152H无源NFC标签实战:从KiCad硬件设计到C固件开发

简介:面向嵌入式与RFID开发者的NFC Type V(ISO 15693)示例工程,围绕TI RF430FRL152H芯片,提供从传感器标签固件到硬件设计的完整参考。压缩包共67个文件,以C源码、KiCad PCB/原理图、PDF数据手册为主&#…

2026/9/9 14:29:29

嵌入式SPI读Flash ID实战:从时序配置到踩坑排查全记录

简介:面向Android平台SPI设备调试场景,这份压缩包提供了一套通过spi ioctl读取Flash ID的App工程与编译产物,适用于驱动开发工程师、硬件验证人员及系统集成者快速确认SPI总线通信状态。资源共含1864个文件,以class、dex、jar等编…

2026/9/9 15:29:41

富士通fi6130扫描仪驱动下载安装与排错实战指南

简介:富士通fi6130扫描驱动是面向fi-6130文档扫描仪用户的官方驱动资源,旨在解决设备与操作系统之间的通信兼容问题,提升扫描速度、图像质量与功能稳定性。压缩包共652个文件,体积约306.56MB,包含dll动态库、exe安装程…

2026/9/9 15:29:41

React Native在OpenHarmony上的RTL适配实践与避坑指南

最近接了个在OpenHarmony设备上跑React Native应用的活,客户那边提了一个听起来不大、做起来却不省心的需求:把App做成阿拉伯语。原本以为无非是套个翻译、改个文案,结果一深入才发现,RTL(Right-to-Left,从…

2026/9/9 15:29:40

K8s离线部署MySQL 5.7:全量离线包制作与实战指南

简介:针对 Kubernetes 集群内网或离线环境中部署 MySQL 5.7 的常见问题,这份资源把镜像包与部署清单打包成套,适合没有外网拉取条件的运维、开发或学习人员使用。压缩包包含 7 个文件,其中有 4 个可直接应用的 YAML 清单、2 个 My…

2026/9/9 15:24:40

OpenAPI开放平台设计实战:从RESTful到AK/SK认证的完整指南

1. 开放平台的本质思考:从接口文档到产品化设计 这些年我经手过的接口项目不少,从内部服务之间的RPC调用,到面向合作伙伴的开放接口,最大的感受是:很多人把OpenAPI开放平台当成“接口文档网页版”来做,这从…

2026/9/9 13:11:35

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/8 7:15:15

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/8 7:15:10

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/9 0:00:48

MHS模型硬件标准:让大模型像调用软件一样控制物理设备

让Claude真正看着显微镜说“这个细胞形态不太对”,或者让大模型自己调一版机械臂的运动轨迹,这事儿听上去已经很接近科幻片了。但你真上手试一次就会发现,模型不缺智商,缺的是一个能插进显微镜、机械臂、激光控制器里的“通用插座…

2026/9/9 0:00:48

AI五大核心方向详解:从机器学习到大模型,零基础转行选哪条?

会有人告诉我,他想转行学AI,但打开招聘网站一看直接傻眼:机器学习、深度学习、自然语言处理、计算机视觉、大模型应用……满屏都是这些词,好像每个都会一点,又好像每个都离自己很远。还有人上来就问“学Python还是学Ja…

2026/9/9 0:00:49

从50行最小循环到生产级AI引擎:工程化改造全解析

直接说干货。这一章我写的不是那种"hello world跑通某个模型"的教程,而是把AI引擎当做一个真正要上线、要被人调用、要扛流量的系统来聊。从最初只有50行的最小循环,到能够承载生产流量的AI引擎,中间差的不是代码量,而是…

2026/9/7 16:23:03

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/7 22:46:00

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/9 10:21:54

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码