发布时间:2026/9/7 5:39:48
【observability】【evaluation23】多模态RAG评估案例分析 案例目标本案例演示如何评估一个多模态RAG(Retrieval-Augmented Generation)系统。与纯文本案例类似我们分别考虑对检索器(Retriever)和生成器(Generator)的评估。具体来说本案例使用美国手语(ASL)字母表图像和文本描述作为多模态数据构建并评估多模态RAG系统。案例的主要目标包括构建基于CLIP图像嵌入和GPT-4V文本描述的多模态RAG系统使用不同多模态LLM(GPT-4V和LLaVA)作为生成器评估检索器的性能(使用hit_rate和mrr指标)评估生成器的性能(使用正确性、相关性和忠实度指标)比较不同多模态RAG系统的性能差异技术栈与核心依赖llama-indexllama-index-llms-openaillama-index-multi-modal-llms-openaillama-index-multi-modal-llms-replicatePILmatplotlibpandas核心组件MultiModalVectorStoreIndex: 多模态向量存储索引用于处理图像和文本数据OpenAIMultiModal: OpenAI的多模态LLM接口(GPT-4V)ReplicateMultiModal: Replicate的多模态LLM接口(LLaVA)MultiModalRetrieverEvaluator: 多模态检索器评估器CorrectnessEvaluator: 正确性评估器MultiModalRelevancyEvaluator: 多模态相关性评估器MultiModalFaithfulnessEvaluator: 多模态忠实度评估器环境配置# 安装必要的依赖 %pip install llama-index-llms-openai %pip install llama-index-multi-modal-llms-openai %pip install llama-index-multi-modal-llms-replicatefrom PIL import Image import matplotlib.pyplot as plt import pandas as pd import json from llama_index.core.multi_modal_llms.generic_utils import load_image_urls from llama_index.core import SimpleDirectoryReader, Document需要配置OpenAI的API密钥以访问GPT-4V服务以及Replicate的API密钥以访问LLaVA模型。案例实现数据准备与索引构建多模态RAG系统构建检索器与生成器评估数据准备本案例使用ASL(美国手语)字母表图像和文本描述作为多模态数据ASL字母表示例图像图像数据来源于ASL-Alphabet Kaggle数据集并进行了修改以在图像上添加相应的字母标签。文本描述来源于https://www.deafblind.com/asl.html。加载图像和文本数据# 加载图像数据 image_path ./asl_data/images image_documents SimpleDirectoryReader(image_path).load_data() # 加载文本描述数据 with open(asl_data/asl_text_descriptions.json) as json_file: asl_text_descriptions json.load(json_file) text_format_str To sign {letter} in ASL: {desc}. text_documents [ Document(texttext_format_str.format(letterk, descv)) for k, v in asl_text_descriptions.items() ]构建多模态索引from llama_index.core.indices import MultiModalVectorStoreIndex from llama_index.core.node_parser import SentenceSplitter node_parser SentenceSplitter.from_defaults() image_nodes node_parser.get_nodes_from_documents(image_documents) text_nodes node_parser.get_nodes_from_documents(text_documents) asl_index MultiModalVectorStoreIndex(image_nodes text_nodes)构建基于文本描述的索引为了比较不同RAG系统我们构建另一个使用GPT-4V生成图像文本描述的索引from llama_index.multi_modal_llms.openai import OpenAIMultiModal from llama_index.core.schema import ImageDocument # 使用GPT-4V生成图像描述 openai_mm_llm OpenAIMultiModal(modelgpt-4o, max_new_tokens300) image_with_text_documents SimpleDirectoryReader(image_path).load_data() # 为每个图像生成文本描述 for img_doc in tqdm.tqdm(image_with_text_documents): response openai_mm_llm.complete( promptDescribe the images as an alternative text, image_documents[img_doc], ) img_doc.text response.text # 解析为节点 image_with_text_nodes node_parser.get_nodes_from_documents( image_with_text_documents ) # 构建基于文本描述的索引 asl_text_desc_index MultiModalVectorStoreIndex( nodesimage_with_text_nodes text_nodes, is_image_to_textTrue )案例效果通过多模态RAG评估我们获得了以下关键发现检索器性能文本检索(asl_index-text)表现完美命中率和MRR均为1.000000基于GPT-4V文本描述的检索(asl_text_desc_index)表现良好命中率和MRR均为0.925926基于CLIP图像嵌入的检索(asl_index-image)表现尚可命中率和MRR均为0.814815当检索器检索到正确图像时通常将其放在第一位因此命中率和MRR相同生成器性能使用LLaVA的RAG系统在正确性、相关性和忠实度方面均优于使用GPT-4V的系统mm_clip_llava在正确性方面得分最高(4.092593)mm_clip_llava在相关性方面得分最高(0.851852)mm_clip_llava和mm_text_desc_gpt4v在忠实度方面得分最高(0.888889)观察与结论评估结果表明使用LLaVA的RAG系统在各项指标上均优于使用GPT-4V的系统。一个有趣的发现是GPT-4V在某些情况下会生成类似我无法基于提供的图像回答查询因为系统目前不允许我视觉分析图像的响应即使图像已被正确检索。这类生成的响应可能是GPT-4V生成评分低于LLaVA的原因之一。案例实现思路多模态RAG评估的实现思路如下数据准备收集ASL字母表图像和相应的文本描述构建多模态数据集索引构建使用MultiModalVectorStoreIndex构建两种不同的多模态索引基于CLIP图像嵌入的索引基于GPT-4V文本描述的索引RAG系统构建构建四种不同的多模态RAG系统比较不同嵌入模型和生成器的组合检索器评估使用MultiModalRetrieverEvaluator评估检索器的性能计算命中率和MRR生成器评估使用正确性、相关性和忠实度评估器评估生成器的性能结果分析比较不同RAG系统的性能分析差异原因技术要点实现过程中的关键技术点包括使用MultiModalVectorStoreIndex处理多模态数据、通过is_image_to_text参数控制使用图像嵌入还是文本描述嵌入、使用MultiModalRetrieverEvaluator评估检索器性能、以及使用多模态评估器(MultiModalRelevancyEvaluator和MultiModalFaithfulnessEvaluator)评估生成器性能。扩展建议基于当前实现可以考虑以下扩展方向扩展多模态数据增加更多类型的多模态数据如视频、音频等改进嵌入模型尝试更先进的多模态嵌入模型如CLIP-ViT-L/14等优化提示工程改进生成提示提高生成质量扩展评估指标引入更多评估指标如多样性、连贯性等领域特定评估针对特定领域(如医疗、教育)定制评估标准人工评估对比引入人工评估作为黄金标准与多模态评估器进行对比评估效率优化优化评估过程提高大规模评估的效率多语言支持扩展对多语言多模态内容的评估能力总结多模态RAG评估案例展示了如何使用llama-index评估工具评估多模态RAG系统。主要收获包括MultiModalVectorStoreIndex提供了处理多模态数据的有效方法不同的嵌入模型(CLIP vs GPT-4V文本描述)对检索性能有显著影响不同的多模态LLM(GPT-4V vs LLaVA)对生成质量有显著影响多模态评估器(MultiModalRelevancyEvaluator和MultiModalFaithfulnessEvaluator)提供了有效的生成评估方法评估结果可以帮助选择最适合特定应用场景的多模态RAG系统该案例为评估多模态RAG系统提供了有价值的参考特别是在需要处理图像和文本混合内容的场景中。通过比较不同嵌入模型和生成器的组合可以更好地理解各组件的优势和局限性从而做出更明智的选择。

相关新闻

2026/9/4 23:24:09

如何用Cocos Creator开发开心消消乐:新手必备的10个核心技能

如何用Cocos Creator开发开心消消乐:新手必备的10个核心技能 【免费下载链接】kaixinxiaoxiaole 使用cocos creator 编写的三消游戏 开心消消乐 项目地址: https://gitcode.com/gh_mirrors/ka/kaixinxiaoxiaole 想要学习使用Cocos Creator开发一款像开心消消…

2026/9/7 1:41:56

为什么我一直喜欢能力比我强的下属

你知道我当年为什么想着去带团队吗?原因其实很简单。因为只有带团队,才能承担更大的责任,才能做更大的贡献。一个人能力再强,影响的始终只是自己负责的那一小块事情。但有了团队以后,就能承担更复杂的项目、更大的业务…

2026/9/7 5:33:56

PsychoPy实验编程指南:从Builder到Coder的完整实践

简介:这是一份面向心理学与神经科学实验研究者的PsychoPy资源包,采用zip压缩格式,整体大小为17.5MB,便于保存、迁移和离线部署。PsychoPy是Python生态中备受认可的开源实验刺激呈现工具,可替代Matlab完成视觉、听觉、触…

2026/9/7 0:47:43

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/7 0:14:19

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/7 0:14:17

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/6 11:40:10

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/6 19:33:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/6 10:19:40

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…