WeKnora 本地大模型部署实操:五步跑通本地知识库 RAG 问答
发布时间:2026/9/6 22:37:37 锦皓数字建站

WeKnora 本地大模型部署实操五步跑通本地知识库 RAG 问答【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora机密文档、财务数据、合规材料把内容交给云端模型 API 提问是企业难以接受的按 token 长期计费也不便宜。WeKnora 是一个开源 LLM 知识平台部署在你自己的服务器上即可完成本地大模型部署与本地知识库搭建文档解析、切分、嵌入、存储全部留在内网并提供 RAG 问答、自主推理 Agent 和自维护 Wiki。为什么选择私有环境部署 ️数据只进自己的库原文、分块文本、嵌入向量都落在自托管 PostgreSQLParadeDB 版自带向量检索全链路无外部 API 调用。断网也能用Ollama 加载模型后问答与文档处理不依赖公网。成本可控没有按量计费机器跑起来只有电费。模型可替换Ollama、OpenAI 兼容端点、Anthropic 等都支持先用 7B 本地模型跑通后续换更强的端点即可。动手前的准备硬件与软件清单 硬件最低配置以本地跑 7B 级模型为基准场景内存CPU磁盘个人试用16 GB4 核40 GB 空闲小团队知识库32 GB8 核100 GB 空闲多用户并发64 GB12 核以上200 GB 空闲建议配 GPU软件依赖Docker 与 Docker Composev2 插件或独立版均可Ollama本地模型运行时start-all脚本可代装手动安装更稳至少 1 个对话模型 1 个嵌入模型嵌入模型把文本变成向量供相似度检索使用只有源码构建才需要 Go / Node.js镜像部署不用自检清单docker info正常返回且docker compose version可用端口 80前端、8080后端未被占用磁盘空闲 ≥ 20 GB镜像 模型权重服务器可访问外网首次启动要拉镜像和模型五步完成本地部署 第 1 步克隆仓库并创建环境文件克隆代码并从模板生成.envgit clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env成功长什么样项目根目录出现.env其中DB_DRIVERpostgres、STORAGE_TYPElocal为默认值可直接使用。第 2 步修改.env关键项数据库与 Redis 密码建议改掉密钥两项生产环境必须换成自己的值SYSTEM_AES_KEY须 32 字节DB_PASSWORD换一个强密码 REDIS_PASSWORD换一个强密码 JWT_SECRET换成随机字符串 SYSTEM_AES_KEY换成32字节密钥 OLLAMA_BASE_URLhttp://host.docker.internal:11434成功长什么样OLLAMA_BASE_URL保持host.docker.internal容器通过它访问宿主机的 Ollama其余占位值已替换。第 3 步安装 Ollama 并拉取本地模型准备一个对话模型和一个嵌入模型可按需替换curl -fsSL https://ollama.com/install.sh | sh ollama pull qwen2.5:7b ollama pull bge-m3成功长什么样ollama list列出两个模型curl http://localhost:11434/api/tags返回它们的 JSON。第 4 步一条命令启动全部服务make start-all成功长什么样docker compose ps中 app、frontend、docreader、postgres 均为Up (healthy)日志末尾提示可通过 http://localhost:80 访问。首次启动会拉取约 4 个镜像耐心等几分钟。验证与首次使用从建库到第一次问答 ✅验证核心端点一条命令确认前后端与模型都活着curl http://localhost:8080/health curl http://localhost:11434/api/tags注册并配置模型。打开 http://localhost 注册第一个账号进入模型管理页注册 Chat 模型Ollama 端点模型名填qwen2.5:7b和 Embedding 模型bge-m3并把二者设为默认。创建本地知识库并上传文档。在“知识库”页新建知识库选择混合检索向量相似度与关键词匹配的组合兼顾语义和相关字面命中上传一份 PDF 或 Word。解析完成后文档列表显示“已处理”并生成可预览的分块。第一次问答。打开聊天页选中刚建的知识库提问“刚才上传的文档讲的是什么”答案下方会带引用来源点击可查看命中的原文分块。如果引用分块和问题相关说明本地模型 本地知识库的整条链路已经跑通。调优与性能优化模型与参数 ⚙️按内存选模型7B 约需 6-8 GB 内存16 GB 机器建议 3B-4B 起步32 GB 以上上 7B-14B回答质量差别明显。分块参数直接影响检索质量config/config.yaml默认chunk_size: 512、chunk_overlap: 50长句密集的文档可调到 768/50改完对文档重新解析才生效。压低生成随机性conversation.summary.temperature默认 0.3知识库问答场景保持低值不建议高于 0.7。批量导入时调并发WEKNORA_ASYNQ_CORE_CONCURRENCY默认 8和WEKNORA_MODEL_MAX_CONCURRENCY默认 32控制后台任务与模型调用并发文档量大时适当上调。监控资源占用curl http://localhost:11434/api/ps查看 Ollama 当前加载的模型与内存docker stats看各容器 CPU/内存内存紧张时用ollama stop 模型名卸载空闲模型。常见问题现象到原因到解决 现象原因解决前端页面打不开80 端口被占用或前端容器未启动.env里改FRONTEND_PORT后重启或看docker compose ps定位上传文档报模型错误嵌入模型未拉取或未注册ollama pull bge-m3并在模型管理页重新选择能聊天但嵌入失败容器内访问不到宿主机 Ollama确认.env中OLLAMA_BASE_URL为http://host.docker.internal:11434答案跑题、漏信息分块与嵌入参数不合适调config/config.yaml的chunk_size/chunk_overlap重新解析文档推理明显变慢模型过大或并发过高换小模型或调低WEKNORA_MODEL_MAX_CONCURRENCY改完密码后启动异常、旧数据不可用数据库初始化后改了DB_PASSWORD等凭证这些值首次启动后不可变更改回原值再重启资源与社区 中文文档与功能总览README_CN.md、docs/API 参考知识库、会话、模型、文档等接口docs/api/Go SDK 示例创建知识库、发起对话client/example.go部署配置说明config/config.yaml内置模型注册指南docs/BUILTIN_MODELS.md源码开发模式docs/快速开发模式说明.md跑通五步你就有了一套完全在本地运转的 RAG 系统。下一步建议导入三五份真实业务文档问十个问题并记下答错的几个再针对性地调分块参数和嵌入模型——动手调一天比读十篇配置文档更有收获。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。