25美元把普通眼镜秒变AI智能眼镜:OpenGlass 保姆级 DIY 全指南

发布时间:2026/10/5 9:07:11

25美元把普通眼镜秒变AI智能眼镜:OpenGlass 保姆级 DIY 全指南 25美元把普通眼镜秒变AI智能眼镜OpenGlass 保姆级 DIY 全指南【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlassOpenGlass 是一个开源智能眼镜方案只需不到 25 美元的现成零件——一块 ESP32 S3 开发板、一颗小电池、一个 3D 打印的眼镜支架——就能把任何一副普通眼镜改造成能识别人物、翻译文本、记录生活的 AI 智能终端。它最大的卖点不是贵而是可破解固件、前端、AI 模型全部开源新手能跑通老手能魔改。先算一笔账一副会思考的眼镜凭什么只值 180 块把会思考拆开看其实就是三件事看摄像头采集画面、想AI 模型理解图像、答把结果展示或播报给你。市面上的智能眼镜动辄几千元是因为它把这三件事打包成了封闭硬件。OpenGlass 的做法相反——它只提供神经和骨架零件作用大致成本Seeed Studio XIAO ESP32 S3 Sense集成了摄像头、麦克风、蓝牙的大脑约 20 美元3.7V 250mAh 锂电池供电能撑数小时约 3 美元3D 打印眼镜支架把零件固定在眼镜腿上约 2 美元合计不到 25 美元折合约 180 元人民币——相当于两杯精品咖啡的钱换来的是一副能看懂世界的眼镜。而看懂这件事本身靠的是你口袋里可能已经有的 GPU 或云 API。一个新手的第一天从克隆代码到戴上眼镜的 8 小时下面以时间线的方式记录一个零基础玩家从零跑通 OpenGlass 的全过程。你会发现每一步其实都有明确的目的地。第 1 小时先把说明书拿到手打开终端把项目拉到本地并安装依赖git clone https://gitcode.com/GitHub_Trending/op/OpenGlass cd OpenGlass yarn install # 或 npm install项目是 ExpoReact Native应用依赖不多装起来很快。装完先别急着跑去认两个人——哦不两个角色。第 2 小时认识大脑和脸面两个角色OpenGlass 的软件栈分两层理解之后一切都顺了firmware/firmware.ino神经中枢这是烧录到 ESP32 S3 上的 Arduino 固件负责初始化摄像头、麦克风通过蓝牙BLE把画面和声音流式传给电脑或手机。它内部还预留了三种音频编码Opus / Mulaw / PCM你可以像换挡一样切换注释来适配不同客户端。sources/目录思考中枢前端拿到画面后交给sources/agent/Agent.ts处理——先把照片送进视觉模型生成文字描述再把多张描述汇总让大模型回答你的问题。简单说固件负责采集Agent 负责理解。第 3~5 小时烧录固件最容易翻车的一段用 Arduino IDE 打开firmware/firmware.ino选择XIAO_ESP32S3开发板后必须先做一个关键设置点击顶部菜单 工具 → PSRAM改为OPI PSRAM。这一步不做烧录后大概率直接内存不足崩溃——这是新手踩得最狠的坑之一。如果你习惯命令行也可以用arduino-cli编译上传arduino-cli compile --build-path build --output-dir dist \ -e -u -p COM5 -b esp32:esp32:XIAO_ESP32S3:PSRAMopi其中COM5换成你机器上识别到的端口可用arduino-cli board list查看。烧录成功后开发板会以OpenGlass为名广播蓝牙信号等着被认领。第 6 小时给眼镜准备本地大脑图像理解需要一个视觉模型。OpenGlass 默认支持 Ollama 本地推理拉一个轻量级模型ollama pull moondream:1.8b-v2-fp16moondream 只有 1.8B 参数普通笔记本就能跑是项目默认推荐的开箱模型。想更强还可以换llava-llama3或llava:34b-v1.6——代价是更吃显存。第 7 小时填密钥启动OpenGlass 的 API 密钥统一放在sources/keys.ts它会从环境变量读取// sources/keys.ts —— 三个服务的密钥入口 export const keys { groq: process.env.EXPO_PUBLIC_GROQ_API_KEY ?? , // Groq极快的 LLM 问答 ollama: process.env.EXPO_PUBLIC_OLLAMA_API_URL ?? , // Ollama本地视觉模型地址 openai: process.env.EXPO_PUBLIC_OPENAI_API_KEY ?? , // OpenAI语音/图像增强 };把EXPO_PUBLIC_GROQ_API_KEY等变量写进项目根目录的.env文件或直接改成字面量然后启动yarn start # 或 npm start浏览器会打开一个本地页面点击Connect to the device系统会自动搜索名为OpenGlass的蓝牙设备——这一步由sources/modules/useDevice.ts实现用的是 Web Bluetooth。第 8 小时戴上它向世界提问一切就绪后眼镜看到的每一帧画面都会被描述成文字你可以像聊天一样追问我刚才看到的路牌上写着什么我面前这个人穿的是什么颜色的外套——回答来自 Groq 上的大模型sources/agent/imageDescription.ts里能看到完整的提示词设计。3 分钟定位关键文件OpenGlass 目录导读文件一句话作用你需要改吗README.md项目总览与官方指南必读firmware/firmware.ino摄像头/麦克风初始化 BLE 传输优化时再动sources/keys.tsGroq / Ollama / OpenAI 密钥配置必须配置sources/agent/Agent.ts照片→描述→问答的核心流程想改交互就研究它App.tsxExpo 应用入口连接设备界面基础使用不用碰prompts/generate.ts批量测试各视觉模型效果的脚本选模型时用新手必看3 个高频坑及解法找不到.envAPI 调用一直失败新版项目不再强制.env密钥统一在sources/keys.ts配置——要么直接填字面量要么补一个.env文件声明三个EXPO_PUBLIC_*变量改完重启yarn start。固件上传报端口未找到先确认 USB 线是数据线而非纯充电线Windows 上到设备管理器确认 COM 端口号再用arduino-cli board list核对设备是否被系统识别。若识别正常仍失败换一根线或换一个 USB 口通常能解决。图像识别卡顿、半天没反应大概率是模型太重了。优先使用moondream:1.8b-v2-fp16这类轻量模型并通过prompts/generate.ts在本地跑一轮模型擂台赛用数据决定去留。进阶玩法让 AI 模型打擂台OpenGlass 附赠了一个非常贴心的工具——prompts/generate.ts。它会读取prompts/series_1/下所有测试图片依次用 moondream、llava-llama3、llava:34b 等模型生成描述并输出成同名.md报告yarn prompts相当于给每个模型发同一套考题谁答得准一目了然。下面这张就是官方测试数据集里的真实画面——多人协作测试智能眼镜原型的现场选好模型后把sources/agent/imageDescription.ts里的默认模型名一换你的眼镜就算换了脑子。这就是开源方案的魅力每一次升级都是改一行代码的事。写在最后你的下一副眼镜由你定义从 25 美元零件到一副能看、能想、能答的 AI 眼镜OpenGlass 把智能穿戴的门槛从几千元降到了两杯咖啡。它不完美——蓝牙传输有延迟、模型选择需要折腾但正因为不完美才给了每个 DIY 爱好者参与和改造的空间。如果你也动心了去 clone 一份代码、烧一次固件、戴上它问世界第一个问题吧也欢迎提交 PR让下一版 OpenGlass 有你的签名。【免费下载链接】OpenGlassTurn any glasses into AI-powered smart glasses项目地址: https://gitcode.com/GitHub_Trending/op/OpenGlass创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/27 9:19:50

盘点,8 款适合线上线下一体化进销存系统

本文要点:线上线下一体化是零售、批发、电商融合型企业的核心诉求——线上订单要自动扣减线下库存,门店销售要实时同步线上可售数量。本文以轻流的多渠道库存同步能力为参照,盘点 8 款主流进销存系统在线上线下一体化方面的适配差异&#xff…

2026/9/27 11:39:30

现代 CSS 升级,要给旧 WebView 留基础布局

现代 CSS 升级,要给旧 WebView 留基础布局 引入 subgrid、动态视口单位之前,先看目标浏览器与 WebView 覆盖范围。新语法能让代码更干净,但不能拿旧环境的基本可用性换这点整洁。 升级时把现代实现作为渐进增强,并保留能工作的 Gr…

2026/10/5 9:02:31

MATLAB驱动SAP2000 API:从对象模型到批处理参数化建模全攻略

1. 为什么我最终选择“MATLAB驱动SAP2000 API”这条路先说背景。我之前在做一个高层框筒结构的参数化对比分析,要一次性算几十个模型:层高变化、柱截面变化、地震工况组合变化。如果靠手动在SAP2000里建模,一个模型至少半个小时,改…

2026/10/5 9:02:31

无人机河道垃圾识别实战:YOLOv11+spacedrone落地指南

1. 项目概述:为什么河道垃圾识别必须用无人机图像识别组合拳?我第一次在长江支流做环保巡查时,站在岸边用望远镜扫了整整两小时,只发现3处漂浮垃圾——而当天无人机飞完12公里河段,自动标记出47个疑似点,人…

2026/10/5 9:02:31

WorkBuddy实战指南:AI Agent办公自动化与MCP协议开发

1. 这不是“又一个AI工具”,而是你办公桌边新来的搭档WorkBuddy这个词,最近三个月我每天打开电脑第一件事就是点开它。不是因为上头,而是因为它真正在帮我扛活儿——上周五下午四点,市场部临时要一份竞品功能对比PPT,我…

2026/10/5 9:02:31

Embedding 向量嵌入:语义空间、相似度与模型选择

一句话怎样变成一串数字 计算机很容易比较数字,却不能直接理解“如何启动服务”和“服务的启动步骤”表达了相近含义。Embedding 模型解决的正是这个问题:它把文本、图片或音频映射成一组稠密向量,让语义关系能够通过数学距离来比较。 “如…

2026/10/5 8:57:31

行人实例分割数据集实战:YOLOv8-seg训练与Re-ID裁剪

简介:行人实例分割数据集面向智能安防、自动驾驶感知、服务机器人交互及计算机视觉研究等场景,为需要训练高精度行人识别与轮廓分割模型的开发者提供可直接使用的工业级数据。资源包共2000个文件,以1226个txt标注文件、772张jpg图像为主&…

2026/10/5 6:32:56

Jev+Agent接管浏览器:browser-use实战与jev-ultrafast性能优化

1. 从“Jev”说起:为什么我要把Agent接进浏览器“Jev”这个词最近在圈子里出现的频率越来越高,很多人第一次听到会以为是某个新模型的名字,其实它更像是一种思路——把Jev模型的能力当作底座,通过Agent的方式去接管浏览器&#xf…

2026/10/4 0:01:02

多智能体集群实战:DeepAgents编排、MCP与A2A协议及Skills体系

1. 从"单兵作战"到"集群协同":多智能体编排到底在解决什么问题如果你最近在折腾 Agent 相关的东西,大概率会有一种感觉:单个 Agent 能做的事情,其实很快就摸到天花板了。你给它一个提示词,挂几个工…

2026/10/4 1:01:05

无源低通滤波器设计实战:从RC到LC,手把手教你避开那些坑

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑