发布时间:2026/7/26 9:30:00
个人项目详述 一、AI作业员-Agent背景地图建设的核心工程之一是POI信息建设POI是指point of intrest现实世界中一系列感兴趣的点比如商铺、学校、医院等等。POI信息则包括POI的名称、地址、坐标、状态等基础信息以及标签、品牌、tips活动等深度信息。POI信息建设中存在部分重难点场景及长尾场景受限于已有策略能力这部分需要依赖专门的人工生产平台 进行人工作业当前平台涉及6类方向总人力120人。人工模式存在两个关键问题一是效率与成本失衡人力成本高且处理时效低 易积压二是不同产线的作业工艺固化新工艺培训成本高不便灵活扩展。目标构建AI数字作业员逐步代替人工生产并变革为高度可扩展的新生产模式。延伸为什么要用智能体而不是工作流等范式行动目前我们在按产线方向阶段性地开发我当前已实现 覆盖用户协同上报-新增POITips生产三个方向的落地。我将分两层次来阐述具体实现首先是高层抽象层次即灵活扩展的通用型架构实现。我们基于Langgraph以 ReAct Agent 范式为核心构建了主-子架构的MultiAgent。其中主智能体负责意图识别与任务分发其中意图识别指根据输入情报综合识别上报意图是否有效或是否存在恶搞任务分发即根据意图匹配下一步路由。子智能体采用ReAct-提示词策略构建“推理-行动-观察”循环并集成多类型工具实现复杂场景下的灵活决策。有哪些多智能体结构Langgraph 框架 是怎么实现react的Function calling 等问题其次是产线维度具象层次我将以覆盖产线下的子智能体互联网情报智能体为代表详述。覆盖产线要做的是核实POI全基础字段信息包括名称、地址、坐标、状态四要素进一步新增或修改关联POI要素值。互联网情报正是覆盖产线的核心生产途径之一1. 互联网情报智能体做什么针对给定的长图文网页url包含图片/视频/文本应提尽提网页中的全部目标POI新店/状态变更若线上无点则新增POI若线上有点则关联并纠错。怎么做首先对上万tokens的工艺手册进行高度精简与剪枝抽象为千位tokens编排好的SOP包括五步骤长图文情报提取 - 多源途径核实 - 坐标计算 - 制作范围判断 - 重复性判断。其次按需打造了10余种能力型工具并规范化定义工具说明包括 图像处理类、信息检索类、特征计算等维度。最后按照ReAct提示词策略融合工具说明与业务提示词以deepseek强语言模型为决策与规划的大脑借助Langgraph框架实现部署推理的全流程。这就是大概的实现方案构成您想我拆解详细模块还是只讲关键难点呢拆解详细模块时间会比较长。关键难点和解决方案包括难点解决方案长图文输入使上下文信息过长易造成信息遗忘外挂情报提取工具单独解析长图文外挂网页细化核实工具查漏补缺联网搜索的资料存在幻觉可溯源性低query - 大搜页检索 - llm筛选有效网页 - 联网模型作针对性检索坐标计算准度不高地址细化模拟人工作业“粗搜 → 细搜”逻辑先联网进行粗粒度搜索核实描述性地址再结合基础信息与周边POI等辅助信息精准搜索详细地址坐标计算父点坐标空间父点的坐标在aoi内随机扰动高德坐标高德有点则直接采纳交叉GC百度GC与高德GC计算的坐标差异在100米内精度达90%可采纳压路落水校验邻近点坐标情报/联网提供建议-邻近点 - 目标地址作开平检索 - 召回相关列表 - llm识别空间邻近点 - 固定偏移 - 压路落水校验强依赖判重能力原链指服务的判重存在较多漏判重问题es➕as召回圆形检索 区域检索 召回列表 - 结合{名称、别名、城市、地址、坐标、距离、标签}新LLM判重严格对照工艺细则扩展优化方向Agent自进化为了进一步突破业务能力瓶颈目前在尝试 ACE 和 Meta harness方案具体做法是以人工作业结论为牵引构建离线自反思进化模块并沉淀优质经验然后定期发版更新线上参考经验实现数据闭环与持续进化。Agent 自进化技术ACEMeta HarnessHarness结果以上就是AI作业员的实现在近两个季度我已从0到1落地了8条子产线智能体涉及三种业务方向达成生产人力精简60%的目标。二、基于VLM的影像自动化生产背景POI 数据建设的核心途径之一是对采集影像的结构化要素提取提取流程包括目标检测、杂质招牌识别、招牌要素提取或门脸状态识别 三个串行环节。其中目标检测环节负责定位影像中的招牌、门脸、建筑等目标杂质招牌识别环节用于判断目标招牌是否属于清晰完整的有效POI招牌结果维度是二分类问题招牌要素提取环节用于精准化抽取招牌中的名称、经营范围、电话等要素。之前杂质招牌识别与要素提取环节都强依赖人工作业面临两大核心痛点时效瓶颈积压风险高与人力成本高。目标为此我们的目标是借助 VLM 重构影像要素生产模式驱动要素提取向自动化、精准化、高时效方向演进。行动针对杂质招牌识别、招牌要素提取两环节我通过Qwen-vl SFT微调分别实现了两个垂类模型的全流程训练与落地。下面我就分别进行讲解1. 杂质招牌识别我设计了基于自适应图像预处理的训练方案方案全流程涵盖三个核心模块分场景建模消除数据分布冲突由于人采集影像高清晰度与车采集影像低清晰度在判断标准和视觉特征上存在显著差异为了规避混合训练出现分布冲突问题依据影像清晰度差异分场景建模。高质完备训练集构建与自适应图像预处理分类体系设计这里我需说明下虽然结果维度只有有效/无效两种类型但实际无效招牌又包括遮挡、模糊、残缺、掉字脱落、指路牌/广告牌、经营标语等多种细粒度类型我选择将原始模型二分类任务升级为细粒度十分类。这样做的原因是十分类能激活更多有价值的神经元提高模型训练难度进而驱动网络学习更丰富的类间差异特征有效提升泛化能力与边界判断的鲁棒性。高质量数据标注基于历史作业人员的质量评估筛选高质量标注人员并开展专项培训分别构建多类别均衡的高质量人采数据集与车采数据集。自适应动态图像预处理这是本方案中提升效果的关键技术环节专为解决该场景下的两类图像理解矛盾而设计。首先该场景天然存在一个图像处理矛盾一方面分辨率跨度大采集影像像素量分布范围极广区间从90万像素到900万像素另一方面任务双重敏感该任务对图像清晰度文字细节与场景环境判断是否为指路牌等均高度敏感导致直接压缩或直接裁剪均不可行一直接压缩可能使清晰招牌文本失真模糊直接裁剪则可能丢失关键周边环境信息。结合模型部署的资源约束与图像处理经验敲定分辨率上限即基准尺寸依据目标招牌尺寸与基准尺寸的相对大小动态确定裁剪范围小目标招牌尺寸远小于基准尺寸采用大扩展比例裁剪保留充足的周边环境信息辅助场景语义理解大目标招牌尺寸接近或超过基准尺寸采用保守扩展策略裁剪为后续缩放到基准尺寸预留空间避免关键信息区域失真模糊高质量图像缩放对超出基准尺寸的图像采用LANCZOS算法降采样以最大程度保留边缘细节与纹理信息。经多轮消融实验验证该策略在保留环境信息与图像细节清晰度之间取得良好折衷为模型提供了高质量的输入表征尤其对车采源场景效果提升显著。VLM模型微调标签映射增强类别学习LoRA 微调 Qwen-VL-3-7B进一步地为适配Qwen-VL的自回归损失引入标签映射机制将十个语义类别抽象映射为数字Token表征强化类别特征的差异化学习提升跨类别判断的精确性。微调训练直至损失曲线平稳收敛最终构建出自动化、高精度的招牌杂质分类模型。2. 招牌要素提取我参考PP-ChatOCR 前沿技术设计了一套跨通道多源信息融合框架核心是融合小而精的ocr模型版面分析能力与VLM强大的语义理解能力实现招牌名称、经营范围等要素的精准提取。方案实现包括四个步骤2.1 实例分割OCR将招牌图输入YOLOv9完成文字区域实例分割再调用PaddleOCRv4文本识别模块进行精细化文本提取。2.2 VLM模型融合多源信息输入融合由招牌图像视觉通道与OCR提取文本文本通道联合构建VLM输入弥补视觉通道在低清场景下的信息损失为啥这样做1. 以轻量化专研模型承担字符级感知任务在低清图像场景下显著优于单纯依赖通用VLM做OCR。2. VLM模型凭借语义理解能力能更好地识别模糊字体纠正ocr模型的错误进一步结合POI领域知识组织任务Prompt对应SOP是「1. 结合图片 校验修正ocr文本2.依据各要素制作规范生成要素值」。基于Qwen-VL-3-8B-Instruct进行SFT LoRA微调在轻量化参数规模下实现垂类能力的注入。2.3 专家知识集成由于通用大模型在POI这一高难度垂类的知识并不完备我引入结构化的专家规则作为后置校验兜底黑名单过滤建立经销商/赞助商噪声黑名单过滤无关实体特殊垂类策略针对银行、营业厅等特殊类别配置专项处理规则必要性在于以低成本规则填补大模型领域知识的短板防控大模型生产的风险幻觉问题保障生产稳定性。2.4 数据飞轮为了持续提升业务效果我们设计了一套高度可复用的模型进化飞轮机制持续收集推理置信度低的边缘/困难样本未自动化这部分数据人工作业的结果被作为标签通过将其扩充到原始训练集触发新一轮模型微调由此实现端到端的模型进化闭环。结果一方面杂质招牌识别与要素提取的自动化率从0 - 85%年降本超310万元。另一方面相比原人工水平杂质招牌识别与要素提取的精度平均提升6%且凭借杂质招牌识别VLM细粒度识别「广告牌/标语」等非POI招牌的优势离线应用 解决线上虚假POI问题共清洗虚假 POI36.23 万问题解决率 98%。三、标签质控大模型背景POI基础标签是商户信息体系的核心直接影响搜索召回、推荐分发和商业化效果。但历史标签数据长期存在三类问题标签错误、标签不细化、多标签缺失。一方面传统质控策略的挖掘有效率不足另一方面部分垂类真值标签过多闭环难度较高。目标首先针对标签质控进行模型升级重点提升标签准确率和细化完备率建立主动发现错误标签、缺失标签和不相关标签的能力降低对负反馈的被动依赖最终支撑搜索推荐效果与商业化指标提升。其次进一步针对重难点-教培垂类进行专项模型迭代提升教培标签细化完备率。行动方案均采用“粗召回精判断”的RAG框架先借助Embedding从全量POI标签体系中召回候选集再结合POI多源情报由LLM聚焦候选集精准判断标签的正确性与完备性。通用基础标签质控模型和教培专项模型二者共享同一套召回框架仅在判断环节有所侧重/差异。召回阶段核心是构建一套高效的候选标签生成机制。首先基于POI名称、经营范围、SKU品类等多源信息构建特征词并进行全局去重随后将特征词向量化在POI标签体系库中检索最相似的Top20标签。这里为让召回更精准有两处细节设计一是三路信号融合的聚合策略计算每个候选标签在POI所有特征词中的“提及频次”保障鲁棒性、“最高相似度”确保精确性以及标签名是否直接出现在特征词中作为“强匹配”兜底高召回。二是引入解释词归一化将标签的扩展定义/补充说明映射到标准标签。最后采用动态阈值过滤根据POI特征词数量自适应调整阈值信息越丰富的POI要求越严格输出高质量候选标签集合。判断阶段对于基础标签质控将候选标签集、POI多源特征和当前线上标签一并输入LLM判断线上标签是否正确以及候选集中是否存在更匹配的标签从而发现错误和可优化点。针对教育培训专项由于标签过多采用对候选标签逐个审视的方法判断每个标签是否适用是否需要补充。这种单标签判断模式既避免了模型一次性处理过多信息导致的知识遗忘与准确率下降又能聚焦于“是否完整细化”这一核心任务高效提升标签的细化完备率。结果一方面25年Q3挖掘付费商户标签问题8.7万错误标签召回率达100%负反馈case维度支持整体付费POI标签准确率从93%提升至98%。另一方面教培付费商户标签准确率86%→97%细化完备率53%→96%。个人优势与价值智能体实战经验不仅知道理论 知识或者停留在demo的构建上而是有应用角度的深层认知知道落地于工程的所有必须环节模块包括智能体技术选型框架的使用与优化贴合业务场景的抽象工艺编排通用能力的构建Agent快速迭代以及agent全方面评估自进化飞轮。能够快速复用经验落地新场景大模型训练多种算法实战经验包括监督微调强化学习等这个优势是我我不盲从权威不仅仅学习现有论文或者现有其他同事的项目或者博客的一些约定俗成的观点或者嗯其他项目约定俗成的做法我能够基于自己的实验去总结经验去创新去沉淀成自己的认知并真正的优化到业务上我能够快速迁移复线先进的技术并针对垂类场景做出呃专项的优化调整比如地比如gpg我是在原提供的代码库上做了损失函数的专项改进之后做了实验对比我是一个善于翻分析问题解决问题的人针对不同场景嗯能够快速的适应新业务了解新业务然后发现新业务的问题发现问题是非常宝贵的因为我们在做嗯项目自动化或者项目优化的时候发现的问题就决定了自动化空间决定了效果的上限只有考虑到足够多的问题点我们也有了足够多的优化点我们做到的模型收益也能是有更好的全面的效果

相关新闻

2026/7/26 9:30:00

基于语义嵌入与HNSW索引的实时新闻可视化系统构建

实时新闻周期可视化地图:基于嵌入标题的每小时重建系统在信息爆炸的时代,如何快速把握新闻周期的脉络和热点演变趋势?传统新闻聚合平台往往只能提供静态的新闻列表,缺乏对新闻间关联性和演变规律的直观展示。本文将介绍如何构建一…

2026/7/26 9:30:00

UEViewer:解锁虚幻引擎游戏资源的逆向工程工具实战指南

1. 项目概述:为什么我们需要UEViewer? 如果你接触过虚幻引擎(Unreal Engine,简称UE),无论是作为游戏开发者、Mod制作者,还是单纯的游戏爱好者,大概率都遇到过一种情况:你…

2026/7/26 10:15:02

Python进阶实战:深入解析推导式与生成器等5大核心特性

大家好,今天我们来深入探讨Python进阶开发中的核心技术。许多开发者在掌握基础语法后,往往面临代码臃肿、内存溢出或工程化程度低等瓶颈。Python提供了丰富的高级特性,只要深入理解其底层原理,就能在日常开发中大幅提升代码质量与…

2026/7/26 10:15:02

三月七小助手:星穹铁道自动化助手终极指南

三月七小助手:星穹铁道自动化助手终极指南 【免费下载链接】March7thAssistant 崩坏:星穹铁道全自动 三月七小助手 项目地址: https://gitcode.com/gh_mirrors/ma/March7thAssistant 还在为《崩坏:星穹铁道》中繁琐的日常任务消耗宝贵…

2026/7/26 10:15:02

解锁Wallpaper Engine资源宝库:RePKG使用全攻略

解锁Wallpaper Engine资源宝库:RePKG使用全攻略 【免费下载链接】repkg Wallpaper engine PKG extractor/TEX to image converter 项目地址: https://gitcode.com/gh_mirrors/re/repkg 你是否曾经被Wallpaper Engine中那些精美的动态壁纸所吸引,想…

2026/7/26 10:10:01

嵌入式视频编码:XDAIS标准接口与MPEG4运动矢量访问实战

1. 项目概述:从标准接口到编码细节的深度探索在嵌入式多媒体开发,尤其是基于DSP(数字信号处理器)的视频编码领域,效率和标准化是永恒的主题。当你面对一块像TI DM6446这样的异构多核处理器,需要在ARM端进行…

2026/7/26 0:03:36

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/26 0:03:36

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/26 2:45:59

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…