发布时间:2026/7/24 12:28:55
【免费】基于Spark实时电商用户行为分析与预测 系统(Python版本+pyspark+可视化大屏+Kafka+FastAPI+Vue3) 锋哥原创出品,必属精品 大家好我是Java1234_小锋老师分享一套锋哥原创的基于Spark实时电商用户行为分析与预测 系统(Python版本pyspark可视化大屏KafkaFastAPIVue3)项目介绍随着电子商务规模持续扩大用户在浏览、加购、收藏与购买等环节产生的行为数据呈现高并发、高吞吐与强时效特征。传统离线批处理分析难以满足运营决策对实时性的要求。本文设计并实现了一套基于 Spark 的实时电商用户行为分析与预测系统围绕“数据采集—流式计算—指标落库—可视化展示—销售预测”的完整链路展开研究与工程实践。系统采用前后端分离架构前端基于 Vue3、Element Plus 与 ECharts 构建管理端与数据大屏后端采用 Python FastAPI 提供 RESTful 接口并结合 JWT 完成管理员身份认证实时链路以 Kafka 作为消息中间件承接行为事件以 Spark Structured Streaming 完成按小时窗口的 PV、UV、加购、收藏、购买与销售额聚合预测模块基于 Spark ML 线性回归对销售额序列进行建模并输出 RMSE、MAE、MAPE 等误差指标。数据持久化采用 MySQL数据库名为 db_ecommerce核心业务表均以 t_ 前缀命名。测试结果表明系统能够稳定完成管理员登录、个人中心维护、行为与商品管理、实时统计展示、销售预测对比及流水线状态监控等功能具备较好的可扩展性与教学示范价值可为电商运营提供实时洞察与辅助决策支持。本文的主要工作包括完成系统需求分析与总体架构设计绘制实体属性图与实体关系图并完成八张核心业务表设计实现基于 Kafka 与 Spark 的实时统计及销售预测链路完成 Vue3 管理端与数据大屏开展功能测试并给出改进方向。研究结果表明将流式计算与 Web 管理系统结合能够在本科毕业设计条件下形成完整、可运行、可解释的实时分析应用。源码下载链接: https://pan.baidu.com/s/1u0yzt7SCx13nEjaH4FSMLw?pwd1234提取码: 1234系统展示核心代码 Spark ML 销售额预测模块 import numpy as np from decimal import Decimal from config import settings def compute_error_metrics(y_true: list, y_pred: list) - dict: 计算误差指标RMSE、MAE、MAPE y_true np.array(y_true, dtypefloat) y_pred np.array(y_pred, dtypefloat) rmse float(np.sqrt(np.mean((y_true - y_pred) ** 2))) mae float(np.mean(np.abs(y_true - y_pred))) mask y_true ! 0 if mask.any(): mape float(np.mean(np.abs((y_true[mask] - y_pred[mask]) / y_true[mask])) * 100) else: mape 0.0 return {rmse: round(rmse, 4), mae: round(mae, 4), mape: round(mape, 4)} def run_spark_prediction(sales_series: list None) - tuple: 使用 Spark ML 进行销售额预测 返回 (predictions, error_metrics) try: from pyspark.sql import SparkSession from pyspark.ml.feature import VectorAssembler from pyspark.ml.regression import LinearRegression from pyspark.sql.types import StructType, StructField, DoubleType, IntegerType, StringType import pyspark.sql.functions as F spark SparkSession.builder \ .appName(SalesPrediction) \ .master(settings.SPARK_MASTER) \ .config(spark.driver.memory, 2g) \ .getOrCreate() spark.sparkContext.setLogLevel(WARN) if sales_series is None: from database import SessionLocal from models.realtime_stat import RealtimeStat db SessionLocal() stats db.query(RealtimeStat).order_by(RealtimeStat.window_time.asc()).all() db.close() sales_series [ {window_time: s.window_time, sales: float(s.sales)} for s in stats ] if len(sales_series) 5: spark.stop() return [], {rmse: 0, mae: 0, mape: 0} # 构造滞后特征 data [] for i in range(3, len(sales_series)): data.append({ window_time: sales_series[i][window_time], lag1: sales_series[i - 1][sales], lag2: sales_series[i - 2][sales], lag3: sales_series[i - 3][sales], hour: int(str(sales_series[i][window_time])[11:13]), sales: sales_series[i][sales], }) schema StructType([ StructField(window_time, StringType()), StructField(lag1, DoubleType()), StructField(lag2, DoubleType()), StructField(lag3, DoubleType()), StructField(hour, IntegerType()), StructField(sales, DoubleType()), ]) df spark.createDataFrame(data, schema) # 划分训练集和测试集后20%作为测试 split_idx max(int(len(data) * 0.8), 1) train_df df.limit(split_idx) test_df df.filter(F.monotonically_increasing_id() split_idx) assembler VectorAssembler( inputCols[lag1, lag2, lag3, hour], outputColfeatures ) train_df assembler.transform(train_df) test_df assembler.transform(test_df) lr LinearRegression(featuresColfeatures, labelColsales, maxIter100) model lr.fit(train_df) predictions_raw model.transform(test_df).collect() predictions [] y_true, y_pred [], [] for row in predictions_raw: true_val float(row[sales]) pred_val float(row[prediction]) predictions.append({ window_time: row[window_time], true_sales: round(true_val, 2), pred_sales: round(max(pred_val, 0), 2), }) y_true.append(true_val) y_pred.append(pred_val) error compute_error_metrics(y_true, y_pred) spark.stop() return predictions, error except Exception as e: print(f[Spark ML] 预测失败: {e}) return None, None def save_predictions_to_db(predictions: list, error: dict): 保存预测结果和误差指标到数据库 from database import SessionLocal from models.prediction import Prediction from models.error_metric import ErrorMetric db SessionLocal() try: # 清空旧预测数据 db.query(Prediction).delete() for p in predictions: db.add(Prediction( window_timep[window_time], true_salesDecimal(str(p[true_sales])), pred_salesDecimal(str(p[pred_sales])), )) db.add(ErrorMetric( rmseDecimal(str(error[rmse])), maeDecimal(str(error[mae])), mapeDecimal(str(error[mape])), )) db.commit() print(f[Spark ML] 已保存 {len(predictions)} 条预测结果) finally: db.close()template div classpage-container div classpage-card div classpage-title销售额预测分析/div !-- 误差指标卡片 -- div classerror-cards div classerror-card div classmetric-labelRMSE (均方根误差)/div div classmetric-value{{ errorMetric.rmse }}/div /div div classerror-card div classmetric-labelMAE (平均绝对误差)/div div classmetric-value{{ errorMetric.mae }}/div /div div classerror-card div classmetric-labelMAPE (平均绝对百分比误差 %)/div div classmetric-value{{ errorMetric.mape }}%/div /div /div !-- 真实 vs 预测对比图 -- div refcompareRef classpred-chart pred-chart-compare/div !-- 残差图 -- div refresidualRef classpred-chart pred-chart-residual/div !-- 预测数据表格 -- el-table :datatableData stripe border stylewidth:100% el-table-column propwindow_time label时间窗口 min-width170 template #default{ row }{{ formatWindowTime(row.window_time) }}/template /el-table-column el-table-column proptrue_sales label真实销售额 min-width130 template #default{ row } span stylecolor:#409eff;font-weight:600¥{{ row.true_sales }}/span /template /el-table-column el-table-column proppred_sales label预测销售额 min-width130 template #default{ row } span stylecolor:#67c23a;font-weight:600¥{{ row.pred_sales }}/span /template /el-table-column el-table-column label误差 min-width120 template #default{ row } span :style{ color: Math.abs(row.true_sales - row.pred_sales) 500 ? #f56c6c : #909399 } ¥{{ (row.true_sales - row.pred_sales).toFixed(2) }} /span /template /el-table-column el-table-column propcreate_time label生成时间 min-width170 template #default{ row }{{ formatDateTime(row.create_time) }}/template /el-table-column /el-table el-pagination stylemargin-top:16px;justify-content:flex-end v-model:current-pagepage v-model:page-sizesize :totaltotal layouttotal, prev, pager, next changeloadTable / /div /div /template script setup import { ref, onMounted, onUnmounted } from vue import * as echarts from echarts import request from /utils/request import { formatDateTime, formatWindowTime } from /utils/format const errorMetric ref({ rmse: 0, mae: 0, mape: 0 }) const tableData ref([]) const page ref(1) const size ref(10) const total ref(0) const compareRef ref(null) const residualRef ref(null) let charts [] /** * X 轴日期时间标签配置分行显示避免底部裁切 */ function buildAxisLabel() { return { rotate: 30, interval: auto, hideOverlap: true, fontSize: 11, margin: 16, formatter(val) { const text formatWindowTime(val) if (text.length 16) return ${text.slice(0, 10)}\n${text.slice(11)} return text }, } } /** * 初始化真实销售额 vs 预测销售额对比图 */ function initCompareChart(data) { const chart echarts.init(compareRef.value) const labels data.map(d formatWindowTime(d.window_time)) chart.setOption({ title: { text: 真实销售额 vs 预测销售额 对比, left: center, textStyle: { fontSize: 15 } }, tooltip: { trigger: axis, formatter(params) { const idx params[0]?.dataIndex ?? 0 const lines [labels[idx] || ] params.forEach(p lines.push(${p.marker}${p.seriesName}: ${p.value})) return lines.join(br/) }, }, // 图例放顶部避免与底部日期重叠 legend: { data: [真实销售额, 预测销售额], top: 32 }, xAxis: { type: category, data: labels, axisTick: { alignWithLabel: true }, axisLabel: buildAxisLabel(), }, yAxis: { type: value, name: 销售额(元) }, series: [ { name: 真实销售额, type: line, smooth: true, data: data.map(d Number(d.true_sales)), itemStyle: { color: #409eff }, lineStyle: { width: 3 }, symbol: circle, symbolSize: 8, }, { name: 预测销售额, type: line, smooth: true, data: data.map(d Number(d.pred_sales)), itemStyle: { color: #67c23a }, lineStyle: { width: 3, type: dashed }, symbol: diamond, symbolSize: 8, }, ], grid: { left: 20, right: 24, bottom: 28, top: 72, containLabel: true }, }) charts.push(chart) } /** * 初始化预测残差分析图 */ function initResidualChart(data) { const chart echarts.init(residualRef.value) const labels data.map(d formatWindowTime(d.window_time)) chart.setOption({ title: { text: 预测残差分析 (真实值 - 预测值), left: center, textStyle: { fontSize: 15 } }, tooltip: { trigger: axis, formatter(params) { const idx params[0]?.dataIndex ?? 0 const p params[0] return ${labels[idx] || }br/${p.marker}残差: ${p.value} }, }, xAxis: { type: category, data: labels, axisTick: { alignWithLabel: true }, axisLabel: buildAxisLabel(), }, yAxis: { type: value, name: 残差(元) }, series: [{ type: bar, data: data.map(d ({ value: d.residual, itemStyle: { color: d.residual 0 ? #409eff : #f56c6c }, })), barWidth: 20, }], grid: { left: 20, right: 24, bottom: 28, top: 56, containLabel: true }, }) charts.push(chart) } /** * 加载预测图表与误差指标 */ async function loadData() { const [errorRes, compareRes, residualRes] await Promise.all([ request.get(/prediction/error), request.get(/prediction/compare), request.get(/prediction/residual), ]) errorMetric.value errorRes.data charts.forEach(c c.dispose()) charts [] initCompareChart(compareRes.data) initResidualChart(residualRes.data) } /** * 分页加载预测结果表格 */ async function loadTable() { const res await request.get(/prediction/list, { params: { page: page.value, size: size.value } }) tableData.value res.data.items total.value res.data.total } onMounted(() { loadData(); loadTable() }) onUnmounted(() charts.forEach(c c.dispose())) /script style scoped /* 预留足够高度保证倾斜日期时间不被裁切 */ .pred-chart { width: 100%; margin-bottom: 24px; } .pred-chart-compare { height: 480px; } .pred-chart-residual { height: 420px; } /style

相关新闻

2026/7/24 12:28:55

AI如何提升计算机教材编写效率与质量

1. 教材编写行业的痛点与AI解决方案教材编写一直是个既需要专业知识又极度耗费时间的工作。传统编写过程中,教育工作者常常面临几个核心难题:内容查重率高、专业术语表达单一、章节结构编排耗时、知识点更新滞后。这些问题直接影响了教材质量和编写效率。…

2026/7/24 12:28:55

Mamba与YOLO结合的目标检测优化实践

1. 项目背景与核心优势去年在目标检测领域出现了一个有趣的现象:当大家都在追逐Transformer架构时,Mamba这种基于状态空间模型(SSM)的新架构悄然崛起。我团队经过半年多的实验验证,发现将Mamba与YOLO结合后&#xff0c…

2026/7/24 12:28:55

AI驱动的GEO智能体:数字营销中的地理定位优化技术

1. 项目背景与核心价值在数字营销领域,GEO(Geographic Targeting)优化一直是品牌精准触达目标受众的关键技术。传统GEO优化主要依赖人工经验判断和基础数据分析,存在响应速度慢、调整周期长、精准度有限等问题。随着AI技术发展&am…

2026/7/24 15:34:09

欧拉路径算法实战:从无序字母对到图论建模与C++实现

1. 项目概述与问题拆解 最近在带学生刷信奥(信息学奥林匹克)题目,P1341“无序字母对”这道题出现的频率不低,但很多初学者一看到“欧拉路径”或者“一笔画”这些词就有点发怵。其实,这道题的核心逻辑非常经典&#xff…

2026/7/24 15:34:09

【毕业设计】基于 Django 的宿舍床位分配与人员管理系统智慧校园宿舍日常事务管理系统设计 (源码+文档+远程调试,全bao定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/24 15:34:09

AI教材写作:降低查重率的三大核心技术

1. AI教材写作的核心痛点与低查重需求教材写作领域正在经历一场由AI技术驱动的变革。作为从业者,我深刻体会到AI辅助写作带来的效率提升,但同时也面临着查重率居高不下的困扰。传统教材写作中,作者需要花费大量时间进行资料收集、内容组织和语…

2026/7/24 15:34:09

学术写作效率提升:工具链搭建与结构化方法论

1. 学术写作效率提升的核心痛点 作为一名长期在科研一线挣扎的研究员,我深刻理解学术写作过程中的效率瓶颈。每次从实验数据整理到论文成稿,总要在各种工具切换和格式调整上浪费大量时间。最让人崩溃的是,当你好不容易写完初稿,导…

2026/7/23 12:54:51

Unity与Python本地通信:基于Flask的跨语言数据交换实战

1. 项目概述:为什么我们需要一个本地通信服务器?在游戏开发、数字孪生、仿真训练等众多领域,Unity作为强大的实时3D内容创作平台,其核心逻辑通常由C#驱动。然而,当我们需要进行复杂的数据分析、机器学习推理、科学计算…

2026/7/24 0:03:10

不同品牌斜齿行星减速机如何替换?以PX与PAG系列为例

不同品牌斜齿行星减速机如何替换?以 PX 与 PAG 系列为例 一、系列对应不等于型号直接互换 PX 与 PAG 都属于斜齿、方法兰、输出轴式精密行星减速机,结构形式和应用方向具有对应关系。 原设备使用PX系列时,可以优先从PAG系列中寻找替换型号。但…

2026/7/24 0:03:10

jdk8 把list 扁平化成String 多个以逗号分隔

在 JDK 8 中&#xff0c;将 List 扁平化为以逗号分隔的 String&#xff0c;有几种非常简洁且高效的方法。&#x1f680; 推荐方案&#xff1a;使用 Collectors.joining()这是最标准的 Java 8 写法&#xff0c;适用于 List<String>。javaimport java.util.stream.Collecto…

2026/7/24 0:03:10

java 两个 long id 怎么合并成一个long id 并且不重复

“把两个 Long ID 合并成一个唯一的 Long ID&#xff0c;且保证不重复”这个需求&#xff0c;在 Java 里直接做数学上的“完美合并”是不可能的。因为两个 Long&#xff08;各 64 位&#xff09;要合并成一个 Long&#xff08;64 位&#xff09;&#xff0c;在信息论上是有损压…

2026/7/23 23:42:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略&#xff1a;快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…