[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"consumer-news-detail-851":3,"consumer-news-interaction-851":39,"consumer-news-related-851":42},{"detail":4,"item":35},{"card":5,"schemaVersion":22,"fields":23,"content":29},{"id":6,"kind":7,"targetType":8,"targetId":9,"subtype":7,"typeLabel":10,"title":11,"subtitle":12,"summary":13,"coverUrl":14,"badgeText":15,"href":16,"sourceName":12,"meta":17,"metrics":19,"tags":20,"resolved":21},"NEWS_ARTICLE:851","news","NEWS_ARTICLE",851,"资讯","多模态知识库，打通文本、图像与视频资源的协同实践与应用","博客园","本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间，用户只需输入一句自然语言，即可一次性召回三种模态的相关资源，并按类型直观展示。","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902092931266-1302274433.png","","\u002Fnews\u002F851",[18],"2026",{},[],true,"consumer-content-detail-v1",{"sourceName":12,"authorName":24,"summary":13,"description":13,"publishTime":25,"updateTime":26,"sourceUrl":27,"language":28},"iNeuOS工业互联网系统","2026-09-02T09:39","2026-09-02T20:37:50","https:\u002F\u002Fwww.cnblogs.com\u002Flsjwq\u002Fp\u002F22802285","中文",{"format":30,"policy":31,"normalized":21,"html":32,"text":33,"wordCount":34,"hasBody":21},"HTML","NEWS_CONTENT_V1","\u003Cp>\u003Cstrong>多模态知识库，打通文本、图像与视频资源的协同实践与应用\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cp>本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间，用户只需输入一句自然语言，即可一次性召回三种模态的相关资源，并按类型直观展示。\u003C\u002Fp>\n\u003Cp>\u003Cstrong>目 录\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cp>1. 背景与痛点.......................................... 2\u003C\u002Fp>\n\u003Cp>2. 技术选型............................................ 2\u003C\u002Fp>\n\u003Cp>3. 关键参数与调优...................................... 3\u003C\u002Fp>\n\u003Cp>4. 效果演示............................................ 3\u003C\u002Fp>\n\u003Cp>4.1 知识库样本..................................... 3\u003C\u002Fp>\n\u003Cp>4.2 上传文本\\图片\\视频............................. 4\u003C\u002Fp>\n\u003Cp>4.3 检索要回效果................................... 4\u003C\u002Fp>\n\u003Cp>5. 局限与展望......................................... 12\u003C\u002Fp>\n\u003Chr>\n\n\u003Cblockquote>\n \u003Cspan>1. 背景与痛点\u003C\u002Fspan>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>　　企业内部的知识与经验以多种形态存在：\u003Cstrong>规章制度、操作手册是文本\u003C\u002Fstrong>；\u003Cstrong>生产工况\u003C\u002Fstrong>、\u003Cstrong>设备照片、产品图像、质检图像是图像\u003C\u002Fstrong>；\u003Cstrong>维修过程、培训录像、生产监控是视频\u003C\u002Fstrong>。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cstrong>　　传统的知识库难以覆盖这些形态\u003C\u002Fstrong>，关键词检索只能匹配文字字段；OCR只能提取图像中的文字，\u003Cstrong>对不含文字的图片（设备状态、产品外观、现场场景）无能为力\u003C\u002Fstrong>；\u003Cstrong>就算基于大模型\u003C\u002Fstrong>，\u003Cstrong>视频内容几乎完全无法被检索\u003C\u002Fstrong>，只能依赖文件名或人工打标签。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cstrong>　　大模型与嵌入技术能够实现\u003C\u002Fstrong>：把不同模态的内容都映射到同一个向量空间中，让“语义相近的内容在空间中被召回”。这样，一句自然语言查询就能同时召回\u003Cstrong>文本、图像和视频\u003C\u002Fstrong>，真正实现跨模态检索。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>　　应用流程示意如下图：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902092931266-1302274433.png?w=720&amp;quality=65&amp;strip=all\" alt=\"1\">\u003Cspan>&#xa0;\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>　　测试系统应用，如下图：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902092956872-620764964.png?w=720&amp;quality=65&amp;strip=all\" alt=\"0.总览\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Cspan>2. 技术选型\u003C\u002Fspan>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>　　嵌入模型方面，通用多模态嵌入模型（Qwen3.5 底座），支持\u003Cstrong>文本、图像、视频与视觉\u003C\u002Fstrong>文档输入，多模态模型的优势在于“\u003Cstrong>一个模型、一个向量空间\u003C\u002Fstrong>”：三类内容映射到同一空间，天然支持跨模态互查，无需多模型拼接与空间对齐。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>　　向量检索引擎方面，选用 \u003Cstrong>FAISS\u003C\u002Fstrong>，使用精确内积索引（IndexFlatIP）。归一化向量的内积即余弦相似度，因此检索分数可直接解释为“相似度”。知识库规模不大时，精确索引零调参、结果无近似误差，实现最简单。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Cspan>3. 关键参数与调优\u003C\u002Fspan>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>　　系统对外暴露四类可调参数，均可在前端参数面板中直接修改并即时生效：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cdiv>\n \u003Ctable>\n  \u003Cthead>\n   \u003Ctr>\n    \u003Ctd>\u003Cp>\u003Cspan>\u003Cstrong>参数\u003C\u002Fstrong>\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>\u003Cstrong>含义\u003C\u002Fstrong>\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>\u003Cstrong>取值范围\u003C\u002Fstrong>\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>\u003Cstrong>默认值\u003C\u002Fstrong>\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n   \u003C\u002Ftr>\n  \u003C\u002Fthead>\n  \u003Ctbody>\n   \u003Ctr>\n    \u003Ctd>\u003Cp>\u003Cspan>取帧间隔（秒）\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>视频采样密度，fps = 1 \u002F 取帧间隔\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>1 ~ 120\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>1\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n   \u003C\u002Ftr>\n   \u003Ctr>\n    \u003Ctd>\u003Cp>\u003Cspan>Top-K\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>返回结果数量上限\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>1 ~ 20\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>3\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n   \u003C\u002Ftr>\n   \u003Ctr>\n    \u003Ctd>\u003Cp>\u003Cspan>相似度阈值\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>相似度低于该值的结果不返回\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>0.1 ~ 0.99\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>0.6\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n   \u003C\u002Ftr>\n   \u003Ctr>\n    \u003Ctd>\u003Cp>\u003Cspan>重复内容阈值\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>结果间余弦相似度达到该值视为重复，只保留一条\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>0.9 ~ 1.0\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n    \u003Ctd>\u003Cp>\u003Cspan>0.98\u003C\u002Fspan>\u003C\u002Fp>\u003C\u002Ftd>\n   \u003C\u002Ftr>\n  \u003C\u002Ftbody>\n \u003C\u002Ftable>\n\u003C\u002Fdiv>\n\u003Cp>\u003Cspan>　　调优经验：取帧间隔越小，视频采样越密、语义信息越完整，但编码耗时与显存占用随之上升；\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>　　相似度阈值决定召回精度与召回率的平衡，业务对误召回敏感时可适当调高；\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>　　重复内容阈值建议不低于 0.9，避免误删相似但不同的内容。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Cspan>4. 效果演示\u003C\u002Fspan>\n \u003Ch2>\u003Cspan>4.1 知识库样本\u003C\u002Fspan>\u003C\u002Fh2>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>&#xa0;&#xa0; 有文本、图像和视频类型的资源，有风景、工业场景、灾难、论文、书籍等。如下图：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093026555-2130252065.png?w=720&amp;quality=65&amp;strip=all\" alt=\"0.知识库样本\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Ch2>\u003Cspan>4.2 上传文本\\图片\\视频\u003C\u002Fspan>\u003C\u002Fh2>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>&#xa0;&#xa0; 分别把文本、图像和视频类型的资源上传到知识库，资源并没有使用真实语义的文件名，也就是检索的时候也不可能依据文件名称进行检索。如下图：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093041721-1938336229.png?w=720&amp;quality=65&amp;strip=all\" alt=\"1.上传的资料\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Ch2>\u003Cspan>4.3 检索要回效果\u003C\u002Fspan>\u003C\u002Fh2>\n\u003C\u002Fblockquote>\n\u003Ch3>\u003Cspan>检索文本内容\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093057721-677403056.png?w=720&amp;quality=65&amp;strip=all\" alt=\"2.检索文字\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索施工\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093123301-266535599.png?w=720&amp;quality=65&amp;strip=all\" alt=\"3.检索施工\">\u003Cspan>&#xa0;\u003C\u002Fspan>\u003C\u002Fspan>\u003Cspan>检索设备\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093150689-1098077740.png?w=720&amp;quality=65&amp;strip=all\" alt=\"4.检索高炉\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索书籍\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093210178-82821087.png?w=720&amp;quality=65&amp;strip=all\" alt=\"5.检索书籍\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索灾难\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093234154-631235936.png?w=720&amp;quality=65&amp;strip=all\" alt=\"6.检索灾难\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索汽车\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093300788-514293096.png?w=720&amp;quality=65&amp;strip=all\" alt=\"7.检索汽车\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索风景\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093403916-1972255313.png?w=720&amp;quality=65&amp;strip=all\" alt=\"8检索风景\">\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索工人\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093417684-1110559997.png?w=720&amp;quality=65&amp;strip=all\" alt=\"9.检索工厂\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索机器人\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093442438-1164682865.png?w=720&amp;quality=65&amp;strip=all\" alt=\"10.检索机器人\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索火灾\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093509023-829161026.png?w=720&amp;quality=65&amp;strip=all\" alt=\"11.检索火灾\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索计量检测单\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093520666-1146322728.png?w=720&amp;quality=65&amp;strip=all\" alt=\"12.检索计量检测单\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索主控室\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093532576-194650719.png?w=720&amp;quality=65&amp;strip=all\" alt=\"13.检索主控室\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索工业设备高炉本体\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cp>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093546025-793300819.png?w=720&amp;quality=65&amp;strip=all\" alt=\"14.检索高炉炉体\">\u003C\u002Fspan>\u003C\u002Fp>\n\u003Ch3>\u003Cspan>检索一个人正在高炉上施工场景\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093558883-321716089.png?w=720&amp;quality=65&amp;strip=all\" alt=\"15.检索一个人正在高炉上施工\">\u003Cspan>\u003Cbr>\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Ch3>\u003Cspan>检索一个人写了一篇论文场景\u003C\u002Fspan>\u003Cspan>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202609\u002F279374-20260902093616909-751062276.png?w=720&amp;quality=65&amp;strip=all\" alt=\"16.检索一个人写了一篇论文，关于软件工程的\">\u003Cspan>&#xa0;\u003C\u002Fspan>\u003C\u002Fspan>\u003C\u002Fh3>\n\u003Cblockquote>\n \u003Cspan>5. 局限与展望\u003C\u002Fspan>\n\u003C\u002Fblockquote>\n\u003Cp>\u003Cspan>&#xa0; &#xa0;应用场景方面，本系统可直接服务于：\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>（1）&#xa0; 制造业生产：设备图片、维修视频、操作手册、生产工况等统一检索，现场“拍张照、说句话”即可定位相关知识；\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>（2）&#xa0; 电商与内容运营：商品图、种草视频、图文详情一库检索，快速复用素材；\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>（3）&#xa0; 企业知识管理：会议纪要、培训录像、规章制度统一沉淀，一次提问即可同时获得三种形态的答案。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cp>\u003Cspan>&#xa0; 多模态知识库的核心价值在于“\u003Cstrong>让知识和场景可被检索\u003C\u002Fstrong>”，把散落在文档、图片、视频里的知识，沉淀为统一可查的向量资产，一句话即可触达。\u003C\u002Fspan>\u003C\u002Fp>\n\u003Cblockquote>\n \u003Cspan>参考文章\u003C\u002Fspan>\n\u003C\u002Fblockquote>\n\u003Cp>（1）硬件网关：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FiKMqn62YIhBlXjGtY2wKXQ\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FiKMqn62YIhBlXjGtY2wKXQ\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（2）物联网（IOT）：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5u4L8fItaFpIbVYOlxbmGg\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5u4L8fItaFpIbVYOlxbmGg\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（3）视觉分析（Vision）：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSiiuXTTGplTAERRYyCmGCQ\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSiiuXTTGplTAERRYyCmGCQ\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（4）大模型智库（AiMind）：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSH_q2k_zbQ-pcd05zj86-g\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSH_q2k_zbQ-pcd05zj86-g\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（5）大模型智能问数（AiInsight）: \u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FA1fIQq_w9c8SW9aEWVIsgw\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FA1fIQq_w9c8SW9aEWVIsgw\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（6）小i助手：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5UCoYsDAbfFP-ZI2sj_QBg\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5UCoYsDAbfFP-ZI2sj_QBg\u003C\u002Fa>。\u003C\u002Fp>\n\u003Cp>（7）视觉模型：\u003Ca href=\"https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FGq74ITDfEwK88jt8b--1PA\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FGq74ITDfEwK88jt8b--1PA\u003C\u002Fa>。\u003C\u002Fp>\n\u003Chr>\n\u003Cp>物联网&amp;大数据技术 QQ群：54256083\u003C\u002Fp>\n\u003Cp>物联网&amp;大数据项目 QQ群：727664080\u003C\u002Fp>\n\u003Cp>QQ：504547114\u003C\u002Fp>\n\u003Cp>\u003Cimg src=\"https:\u002F\u002Fi1.wp.com\u002Fimg2024.cnblogs.com\u002Fblog\u002F279374\u002F202509\u002F279374-20250924180005285-1427975355.png?w=720&amp;quality=65&amp;strip=all\" alt=\"image\">\u003C\u002Fp>","多模态知识库，打通文本、图像与视频资源的协同实践与应用 本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间，用户只需输入一句自然语言，即可一次性召回三种模态的相关资源，并按类型直观展示。 目 录 1. 背景与痛点.......................................... 2 2. 技术选型............................................ 2 3. 关键参数与调优...................................... 3 4. 效果演示............................................ 3 4.1 知识库样本..................................... 3 4.2 上传文本\\图片\\视频............................. 4 4.3 检索要回效果................................... 4 5. 局限与展望......................................... 12 1. 背景与痛点 　　企业内部的知识与经验以多种形态存在：规章制度、操作手册是文本；生产工况、设备照片、产品图像、质检图像是图像；维修过程、培训录像、生产监控是视频。 　　传统的知识库难以覆盖这些形态，关键词检索只能匹配文字字段；OCR只能提取图像中的文字，对不含文字的图片（设备状态、产品外观、现场场景）无能为力；就算基于大模型，视频内容几乎完全无法被检索，只能依赖文件名或人工打标签。 　　大模型与嵌入技术能够实现：把不同模态的内容都映射到同一个向量空间中，让“语义相近的内容在空间中被召回”。这样，一句自然语言查询就能同时召回文本、图像和视频，真正实现跨模态检索。 　　应用流程示意如下图： 　　测试系统应用，如下图： 2. 技术选型 　　嵌入模型方面，通用多模态嵌入模型（Qwen3.5 底座），支持文本、图像、视频与视觉文档输入，多模态模型的优势在于“一个模型、一个向量空间”：三类内容映射到同一空间，天然支持跨模态互查，无需多模型拼接与空间对齐。 　　向量检索引擎方面，选用 FAISS，使用精确内积索引（IndexFlatIP）。归一化向量的内积即余弦相似度，因此检索分数可直接解释为“相似度”。知识库规模不大时，精确索引零调参、结果无近似误差，实现最简单。 3. 关键参数与调优 　　系统对外暴露四类可调参数，均可在前端参数面板中直接修改并即时生效： 参数 含义 取值范围 默认值 取帧间隔（秒） 视频采样密度，fps = 1 \u002F 取帧间隔 1 ~ 120 1 Top-K 返回结果数量上限 1 ~ 20 3 相似度阈值 相似度低于该值的结果不返回 0.1 ~ 0.99 0.6 重复内容阈值 结果间余弦相似度达到该值视为重复，只保留一条 0.9 ~ 1.0 0.98 　　调优经验：取帧间隔越小，视频采样越密、语义信息越完整，但编码耗时与显存占用随之上升； 　　相似度阈值决定召回精度与召回率的平衡，业务对误召回敏感时可适当调高； 　　重复内容阈值建议不低于 0.9，避免误删相似但不同的内容。 4. 效果演示 4.1 知识库样本 有文本、图像和视频类型的资源，有风景、工业场景、灾难、论文、书籍等。如下图： 4.2 上传文本\\图片\\视频 分别把文本、图像和视频类型的资源上传到知识库，资源并没有使用真实语义的文件名，也就是检索的时候也不可能依据文件名称进行检索。如下图： 4.3 检索要回效果 检索文本内容 检索施工 检索设备 检索书籍 检索灾难 检索汽车 检索风景 检索工人 检索机器人 检索火灾 检索计量检测单 检索主控室 检索工业设备高炉本体 检索一个人正在高炉上施工场景 检索一个人写了一篇论文场景 5. 局限与展望 应用场景方面，本系统可直接服务于： （1） 制造业生产：设备图片、维修视频、操作手册、生产工况等统一检索，现场“拍张照、说句话”即可定位相关知识； （2） 电商与内容运营：商品图、种草视频、图文详情一库检索，快速复用素材； （3） 企业知识管理：会议纪要、培训录像、规章制度统一沉淀，一次提问即可同时获得三种形态的答案。 多模态知识库的核心价值在于“让知识和场景可被检索”，把散落在文档、图片、视频里的知识，沉淀为统一可查的向量资产，一句话即可触达。 参考文章 （1）硬件网关：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FiKMqn62YIhBlXjGtY2wKXQ。 （2）物联网（IOT）：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5u4L8fItaFpIbVYOlxbmGg。 （3）视觉分析（Vision）：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSiiuXTTGplTAERRYyCmGCQ。 （4）大模型智库（AiMind）：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FSH_q2k_zbQ-pcd05zj86-g。 （5）大模型智能问数（AiInsight）: https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FA1fIQq_w9c8SW9aEWVIsgw。 （6）小i助手：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002F5UCoYsDAbfFP-ZI2sj_QBg。 （7）视觉模型：https:\u002F\u002Fmp.weixin.qq.com\u002Fs\u002FGq74ITDfEwK88jt8b--1PA。 物联网&大数据技术 QQ群：54256083 物联网&大数据项目 QQ群：727664080 QQ：504547114",2271,{"id":6,"kind":7,"title":11,"summary":13,"image":14,"href":16,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":38},"#2563eb","16 \u002F 10",[7,8],{"targetType":8,"targetId":9,"likedByMe":40,"likeCount":41,"commentCount":41,"contentLikeCount":41,"contentCommentCount":41,"sourceLikeCount":41,"sourceCommentCount":41},false,0,[43,52,58,65,73,80,86,93],{"id":44,"kind":7,"title":45,"summary":46,"image":47,"href":48,"meta":49,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":50},"NEWS_ARTICLE:827","MHS 三部曲（下）：谁允许 AI 行动？——权力、合规与中国厂商的答卷","我们总在等待一个像 ChatGPT 那样的机器人时刻。但具身智能真正的拐点，也许先发生在更不起眼的地方：一台陌生设备，第一次能把自己的能力、状态和边界完整告诉 AI；一个 Agent，第一次能把试出来的经验固化成可验证、可复用的机器技能。","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F510\u002F202608\u002F510-20260830153745229-1536981088.jpg","\u002Fnews\u002F827","2026 · 人工智能",[51],"人工智能",{"id":53,"kind":7,"title":54,"summary":55,"image":15,"href":56,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":57},"NEWS_ARTICLE:829","我不会美工，用 WorkBuddy 1 分钟做出 4 张海报","先说结果：下面这 4 张海报，从我发出指令到拿到图片，大约 1 分钟。 我不会美工，也没有打开 Photoshop。用的工具，是我之前用 WorkBuddy 做的一个海报生成器。这个生成器本身也没花几分钟，具体开发过程我在上一篇文章里写过。 这次我把海报生成器的网址、产品截图和要求一起发给 Work","\u002Fnews\u002F829",[7,8],{"id":59,"kind":7,"title":60,"summary":61,"image":62,"href":63,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":64},"NEWS_ARTICLE:828","一个人抵一个团队的时代，企业级 AI Agent 还需要做什么？","对于企业而言，真正需要的，不是一个“会聊天”的 Agent，而是一套能被多用户、多场景复用，且权限清晰、过程可审计、成本可控制的 Agent 能力体系。","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F2232255\u002F202609\u002F2232255-20260902173524728-659996478.png","\u002Fnews\u002F828",[7,8],{"id":66,"kind":7,"title":67,"summary":68,"image":15,"href":69,"meta":70,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":71},"NEWS_ARTICLE:832","用 runtime-async 写一个支持 async\u002Fawait 的轻量脚本引擎","起因：一个好奇 事情的开头很简单。 给 .NET 做过动态脚本的人大概都碰到过同一堵墙：表达式树也好、Reflection.Emit 也好，都很难支持 async\u002Fawait。原因不在语法，而在 await 的实现方式——C# 编译器要为每个 async 方法生成一个状态机结构体，把方法体切成若干片","\u002Fnews\u002F832","2026 · 软件开发",[72],"软件开发",{"id":74,"kind":7,"title":75,"summary":76,"image":77,"href":78,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":79},"NEWS_ARTICLE:831","Agent Sandbox 规模化：JuiceFS 探索与实践","过去一段时间，我们在和云厂商以及 Agent 团队推进 Sandbox 落地时，除了要解决数据如何进入 Sandbox，还需要考虑任务所需的数据和执行过程中产生的数据，如何跨任务、跨阶段持续使用。Sandbox 可以随任务快速创建和销毁，但数据往往需要继续保留、共享和流转。 当 Sandbox 并发","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F2544292\u002F202609\u002F2544292-20260902171045357-1907499098.png","\u002Fnews\u002F831",[7,8],{"id":81,"kind":7,"title":82,"summary":83,"image":15,"href":84,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":85},"NEWS_ARTICLE:830","百智云长期记忆服务：长期记忆与上下文窗口的区别","很多人在接触 AI 长期记忆时，第一反应是：「这不就是把聊天记录存起来吗？」其实这是一个很常见的误解。今天我们把「长期记忆」和「上下文窗口」这两个概念彻底讲清楚。 一、什么是上下文窗口 上下文窗口（Context Window）是模型在单次推理时能「看到」的文本上限。它像一个临时的工作台：模型只能处","\u002Fnews\u002F830",[7,8],{"id":87,"kind":7,"title":88,"summary":89,"image":90,"href":91,"meta":49,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":92},"NEWS_ARTICLE:835","体验向量数据库 qdrant","作者:张富春(ahfuzhang)，转载时请注明作者和引用链接，谢谢！ cnblogs博客 zhihu Github 公众号:一本正经的瞎扯 背景 为了早点搞懂公司的百万行 C# 的祖传代码，我想在缺乏文档、缺乏帮手的情况下，先建立一个 企业知识库 来快速帮我理清头绪。 一开始，我是打算以 weav","https:\u002F\u002Fimg2022.cnblogs.com\u002Fblog\u002F1457949\u002F202202\u002F1457949-20220216153819145-1193738712.png","\u002Fnews\u002F835",[51],{"id":94,"kind":7,"title":95,"summary":96,"image":15,"href":97,"meta":18,"badge":10,"author":12,"stats":-1,"accent":36,"coverRatio":37,"tags":98},"NEWS_ARTICLE:833","如何利用AI技术实现漫画翻译","漫画作为图文结合的特色文化载体，承载着各国潮流文化与人文故事，但跨语言的文字壁垒，长期制约着漫画的传播与交流。传统漫画翻译高度依赖人工操作，需要人工框选文字、擦除原图文字、翻译文案、排版适配画风，流程繁琐、耗时费力，且极易出现排版错乱、画风违和、语义偏差等问题。 随着深度学习、计算机视觉与大模型技术","\u002Fnews\u002F833",[7,8]]