P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

前言

前两天我干了件有点无聊但值得说的事:问一个知识库「什么是人形机器人?把结果写到 Docx 文件里」。

你可能觉得这有啥稀奇的,AI 现在不都会写文档吗?

问题在于,它没有回我一段话。

它思考了 17 轮、调用了 20 次工具、花了 2 分 38 秒。我一度以为它卡死了,正准备打开任务管理器给它一个体面的告别,结果它递过来一个排版完整的 Word 文件。

那一刻我确定了三件事:它不是客服,它是外包,而且比我勤快。

它自己搜关键词,从知识库里读回 4 篇文档,把片段拼成大纲,然后读了一遍 docx 技能的说明书,在沙箱里写下脚本,跑通,交付。全程我没有复制粘贴过一次。

一、这项目什么来头

干这事的项目叫 WeKnora,腾讯微信团队开源,MIT 协议,当前版本 0.8.0,Go + Vue 写的。

说它「微信团队出品」是有实据的:官网挂在 weixin.qq.com 域名下,它是微信对话开放平台的核心技术框架,npm 包 scope 里有 wxg——微信事业群。不是实验室里放出来刷存在感的,是亲儿子。

1. 官方给它定的调子

一句话:把文档变成「活的」知识。注意「活的」这个词。

它不是「上传文档 → 向量化 → 问答」这条老路再走一遍,而是由三块能力组成:

能力干什么一句话理解
RAG 快速问答日常查资料、问文档动嘴
ReAct Agent自主编排检索、MCP 工具、技能目录、沙箱、联网搜索动手
Wiki 模式把原始文档蒸馏成自维护、互相链接的 Markdown 知识库自己长

动嘴、动手、自己长。你品品,这哪是知识库,这是三头六臂的打工人。

2. 基本盘

项目数值
开源方腾讯微信团队
协议MIT(商用友好)
当前版本v0.8.0
技术栈Go + Vue,模块化可插拔
部署方式本地 / Docker / Kubernetes(Helm),支持私有化与离线
适配模型20+ 家 LLM 供应商(含 LiteLLM)
文档格式PDF / Word / Txt / Markdown / HTML / EPUB / MHTML / 图片 / CSV / Excel / PPT / JSON / XMind
IM 渠道企业微信 / 飞书 / Lark / QQBot / Slack / Telegram / 钉钉 / Mattermost / 微信 / 云之家

注意最后两行:17 种文档格式,10 个 IM 渠道。国内同类项目里,这两行属于比较少见的部分。

二、核心变化:知识库从「嘴替」到「手替」

1. 先回忆一下以前的苦日子

你问它「咱们报销标准是多少」,它检索出三段相关文本,拼成一段话给你。然后呢?然后没了。整理成表格、写进文档、发出去,全是你自己动手。

它就像那种只会说「亲,这边建议您手动处理哦」的客服。态度很好,问题一个没解决。

WeKnora 0.8.0 把这段断掉的路接上了。怎么接的?技能 + 沙箱。

2. 第一层:技能目录

技能不再散落在各个 Agent 里,而是像应用商店一样集中管理,可以从 ClawHub、SkillHub、git 仓库或者 zip 包安装。

就像我手机里装了 200 个 APP,常用的只有 5 个,但目录必须整整齐齐。

3. 第二层:沙箱

技能必须装进沙箱才能被调用。0.8.0 支持三种后端:Docker / E2B / Cube,而且是会话级持久的——同一个会话里,上一轮写下的文件和装好的环境,下一轮还在。

比我的记忆力强多了。我上周放的文件,这周就找不到了。

4. 装好之后,它手里有真东西了

Agent 拿到的是真实可用的工具:shell_exec 执行命令、文件读写、产物管理,还有可按配置收紧的网络策略。

注意,这不是「生成一段代码给你看」,而是在隔离环境里把代码跑起来。一个是给你看菜谱,一个是真把菜炒了端上来,区别很大。

三、那只「手」是怎么装上的

1. 最聪明的一步:先读说明书

回到开头那个场景,过程里有一处特别妙:Agent 并不是天生会写 Word——它是先读了 docx 技能的说明书,才知道该调用哪个库、怎么写脚本。

你品品,这像不像刚入职的实习生?先翻一遍手册再开始干活。技能在这里扮演「操作手册」,沙箱提供「干活的地方」。

2. 一个值得单独点赞的安全细节

如果你在选型,这条比上面的功能更值得看:0.8.0 移除了 Local host-process 后端,Docker 改成需显式开启。

翻译成人话:上一版允许技能直接在你宿主机上跑进程,这一版把它砍了,默认只走 Docker / E2B / Cube 这些隔离环境,每个租户还能配独立的网络策略。

在「让 AI 动手」这件事上,先收紧执行边界、再放开能力,这个顺序是对的。国内不少项目是反着来的——先把能力做出来,安全问题留给下一代。

它这一步,是自己给自己上枷锁。挺好,知道自己力气大了,先把自己关进玻璃房再蹦迪。

四、它把我的文档重新「翻译」了一遍

1. 传统 RAG 的毛病在哪

如果说沙箱解决的是「动手」,Wiki 模式解决的是「理解」。

传统 RAG 有个绕不开的毛病:它检索的是切片,不是知识。你上传 50 份文档,它切成 3000 个片段存进向量库。它能找到「包含这个关键词的段落」,但它不知道这些段落之间是什么关系。

就像你把一本 500 页的小说撕成纸条,然后问它「主角最后死没死」,它给你找出 50 张写着「死」字的纸条。信息全对,知识全无。

2. 换个思路:读完了重新写一遍

Wiki 模式让 Agent 把原始文档读完之后,重新写成一套互相链接的 Markdown 页面。

切片是不可读的,Wiki 页面是可读的。切片是给机器检索用的中间产物,Wiki 页面是给人看的知识资产。就像后厨那堆切好的菜是给厨师用的,端上桌的菜才是给人吃的。

3. 还有一张知识图谱

配合知识图谱视图,你能直观看到某个概念被哪些文档支撑、它和哪些实体相连。图例里分了链接、实体、概念、综合、对比五种关系类型。

这一步,是它从「检索工具」进化成「知识管理」的标志。

4. 关键:它不是黑盒

它没做成「只能看不能改」的黑盒。Wiki 页面支持修订历史——快照、行级 diff、一键回滚,还能直接在浏览器里手动编辑。

自动生成 + 可编辑 + 有版本 + 可回滚,这一套组合让它从「AI 生成的内容」变成了「你能接管的内容」。这条决定了它能不能进真实业务——自动生成的东西一旦不可修正,就没有人敢用。

就像同事交给你一份 PPT,你要是改不了,只会想重做一份。

五、它开始记事

0.8.0 另一个更新是跨会话长期记忆,分五类:profile(用户画像)、preference(偏好)、fact(事实)、task(任务)、interest(兴趣)。

机制是自动抽取 + 用户确认 + 按需检索。注意中间那步「用户确认」——它没有偷偷记你。不像某些 APP,我昨天搜了个「脱发怎么办」,今天全平台给我推植发广告。

这个设计对知识库挺关键。因为知识库最痛的不是「记不住」,是每次都问一遍「你们公司是做什么的」「上一个问题聊到哪了」。

像极了相亲,每次都要重新自我介绍:我,月薪八千,有房(贷),无车(贷得起)。

六、两个细节控福利

1. 树状文件夹视图

大部分知识库上传完文档就是一大坨平铺列表,你上传时精心分好的目录全丢了。文件一多,找东西全靠搜索。

像极了你电脑桌面:图标铺满,找不到文件,全靠心里默念它的名字。

WeKnora 把上传路径当成一等数据存下来了,目录可浏览、可重命名、可重新归类。这是个很小的决定,但省掉的是后面无数次的翻找。

2. 切片可以被修正

这条我认为是所有做 RAG 的人都该抄的。

RAG 的准确率问题,八成出在切片上:切太碎丢上下文,切太粗引入噪音,切错边界把两段不相干的内容拼一起。传统做法是「改配置 → 重新解析整个知识库」,成本高、反馈慢。

它可以直接在界面上编辑检索切片,每个版本有快照、可 diff、可一键回滚,保存后自动重建索引。

这一下把「调 RAG 效果」从一件要重跑流水线的事,变成了改一段文字的事。以前调参像玄学,现在改字像改错别字。

七、它把选择权全给了你

1. 输入渠道做了 8 类

除了网页,还有 10 个 IM 渠道、浏览器扩展、CLI、MCP Server、网页嵌入组件。

它没把自己做成「你必须登录网页才能用」的系统。知识库应该出现在你已经工作的地方,而不是让你多开一个标签页。就像外卖应该送到你家门口,而不是让你去自提点取。

2. 每一层都可替换

层支持的后端
LLMOpenAI / Azure OpenAI / Anthropic / DeepSeek / 通义千问 / 智谱 / 混元 / 豆包 / Gemini / MiniMax / NVIDIA / Novita AI / SiliconFlow / OpenRouter / Requesty / LiteLLM / Ollama
向量库PostgreSQL(pgvector) / Elasticsearch / OpenSearch / Milvus / Weaviate / Qdrant / Apache Doris / 腾讯 VectorDB
对象存储本地 / MinIO / AWS S3 / 火山 TOS / 阿里 OSS / 金山 KS3 / 华为 OBS
嵌入模型Ollama / BGE / GTE / 智谱 / OpenAI 兼容接口
联网搜索DuckDuckGo / Bing / Google / Tavily / 百度 / Ollama / SearXNG / Keenable / 智谱 / Exa / Metaso

自由度大的另一面是选择成本。像自助餐,选择多到让你站在餐台前陷入哲学沉思。好在默认配置能直接跑通。

3. 保留了「完全私有化」这条路

所有组件都能换成自建,支持本地 / 私有云部署,数据主权在你自己手里。对要处理内部文档的团队来说,这是硬门槛。

毕竟,有些文档放公网云上,老板会连夜给你发一串问号。

4. 运维视角也没落下

可观测性集成了 Langfuse,做全链路追踪:ReAct 循环、token 消耗、工具调用、流水线逐阶段耗时。还有一个运行时任务队列看板,能看队列深度、按模型并发数、失败任务检查与手动重试。

这类「运维视角」的东西,往往比功能列表更能说明一个项目有没有被真实使用过。Demo 项目不会做失败任务重试。做了失败重试的项目,说明它被真实用户虐过。

八、你可能早就见过它

这一段是给做公众号的朋友看的。

WeKnora 是微信对话开放平台的核心技术框架。也就是说:你可以在平台上零代码部署——上传知识、配好问答,能力就接进微信生态了;高频问题可以分类管理,有数据工具兜底,答案可维护;这套问答能力能接进公众号、小程序等场景。

换句话说,你在公众号后台配的那套自动问答,底层引擎很可能就是它。

你以为你用的是「公众号自带功能」,其实是一个开源项目在默默打工。打工人打工魂。

1. 它没想当一个孤岛

它还给了几个轻量接入方式:

入口用途
浏览器扩展网页上划词、选图、整页收藏,一键存进知识库
微信小程序手机上配 API、选知识库、导 URL、直接问答
CLI(weknora)终端里驱动,agent-first 设计:默认输出稳定 JSON(带类型化错误码),–format text 给人看
MCP Server官方 PyPI 包 tencent-weknora-mcp,29 个工具,支持 stdio / SSE / HTTP
ClawHub Skill装到 ClawHub 后,Agent 可直接导入文档、混合检索、管理知识条目
DeepSeek Harness 插件给你的编码 Agent 挂上自己的文档库

最后那条 MCP Server 值得多说一句:29 个工具、三种传输方式,意味着它可以作为「知识底座」接进任何支持 MCP 的 Agent 里。

它想当那个所有人都来插一脚的插线板。

九、五条命令领回家

前置只要 Docker + Docker Compose:

git clone https://github.com/Tencent/WeKnora.git
cd WeKnora
cp .env.example .env      # 按需编辑,文件里注释写得很细
docker compose pull
docker compose up -d

起来之后访问 http://localhost 就能用。如果要用本地 Ollama 模型,先起 ollama serve。

需要额外组件的话,用 profile 按需加载:

Profile用途
默认核心服务
full全功能
neo4j知识图谱
minio对象存储
langfuse链路追踪

服务地址:Web UI http://localhost · 后端 API http://localhost:8080 · Langfuse http://localhost:3000。

官方安全提示里有一条务必记住:生产部署建议放内网,不要直接暴露公网。翻译:别把家门钥匙挂在大门口。

另外这项目迭代非常快(0.8.0 之前已经跑了十几个小版本),升级时记得先 docker compose pull 再 up -d,不然容器还在用本地缓存的旧镜像,会出现「UI 版本对不上」的诡异问题。

像极了穿去年的秋裤配今年的外套,怎么看怎么别扭。

十、一些实话

1. 它押的不是「答得准」,是「能把活干完」

这一年 RAG 项目的竞争几乎全在准确率上——改切分策略、加 rerank、叠图谱。这些都有价值,但天花板很明显:你把答案准确率从 80% 提到 92%,用户的流程一样没变,他还是得自己把答案搬去别的地方。

WeKnora 0.8.0 换了个赛道:让知识库在沙箱里把活干完。查完资料直接生成 Word、Excel、PPT,写完直接存进文件系统。

用户要的从来不是「答案」,是「事情被办完」。就像你去饭店不是为了听厨师报菜名,是为了吃上饭。

2. 安全上先收了手

「让 AI 在你机器上执行代码」,现在是 AI 产品里风险最高的动作之一。先把边界收窄再放能力,说明团队清楚自己在开什么口子。

3. 「可干预」的执念贯穿始终

切片可编辑、Wiki 可回滚、技能可登记、任务可重试、记忆要确认。这套设计语言的共同点:不把 AI 的产物当成不可触碰的结论,而是当成随时可以接管的半成品。

4. 门槛和不太适合的场景

(1) 它不是开箱即用的 SaaS

自部署要处理 Docker、模型 API、向量库,比注册个账号麻烦得多。想零门槛可以先走微信对话开放平台。

(2) 能力越强,配置面越大

20+ 模型、8 种向量库、7 种存储——自由度的另一面是选择成本。

(3) 沙箱执行必然有算力开销

一次任务跑 2 分多钟、20 次工具调用,比一句问答重得多。这适合「值得花时间把事做完」的场景,不适合闲聊。像请了个全能管家,能干,但出场费不低。

(4) MIT 协议是加分项

商用友好,不用纠结授权条款。

5. 一句话总结

如果你在找一个能长期沉淀、能自己动手、能私有化的知识底座,它目前是国内开源里最完整的一个。如果你只是想要个问答窗口,它有点重。

就像你只想买把伞,结果对方给你推荐了一辆房车。

十一、最后

回到最开始那个问题:为什么我们的知识库只会动嘴?

因为过去我们做的其实不是「知识库」,是「文档检索器」。它只负责把相关内容找出来递给你,剩下的活是你干的。

WeKnora 0.8.0 想改的是这个分工:把最后那段路也走完。

「知识库不再只动嘴,还能在沙箱里动手」——这句话听起来像个噱头,但拆开看,它是三件很实的事:技能有目录、沙箱有隔离、产物有交付。噱头背后是工程。

仓库地址:github.com/Tencent/WeKnora。官方文档约 50 页,覆盖 360+ API 接口和 150+ 环境变量,支持独立部署;官方演示视频 2 分 25 秒,仓库首页就能看。

最后留个问题:如果给你的知识库装上「手」,你最想让它替你干的第一件事是什么?

是批量把内部文档整理成周报,还是查完资料自动生成对客方案,又或者每天定时扫一遍行业资讯、直接产出摘要?评论区说说你的场景,我挑几个具体的需求,下一篇写一份能跑通的最小配置教程。

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐