🐋BlueKing Lite 是腾讯蓝鲸开源的 AI First 轻量版运维平台,专为中小规模运维场景设计,以 4核8G 的极低资源占用,提供从监控、日志、CMDB 到 AI 智能体(OpsPilot)的完整运维能力。


🎯 背景:

洞察一:规模小 ≠ 问题简单 🔍

“管 50 台服务器和管 5000 台服务器,哪个更简单?”

大多数人会直觉地回答"50 台"。但实际情况是:

  • 硬件资源维度 🖥️:为大规模设计的运维平台动辄需要 128G 内存 起步,平台自身消耗的资源可能比要管理的所有服务器加起来还多
  • 人力资源维度 👥:小规模团队往往只有 1~2 个运维人员,既要保业务稳定,又要学新平台,还要处理日常琐事
  • 时间成本维度 ⏱️:大规模团队可以花两三个月慢慢上线,小规模团队的业务压力要求快速见效

核心结论:规模变小了,但问题的复杂度并没有按比例下降。业务对稳定性的要求依然很高,但可用资源大幅缩水。

洞察二:完整体系,有时反而是障碍 🧱

传统一体化运维平台的设计逻辑是"先建地基,再盖房子"——CMDB 是地基,监控、告警、作业都是房子。管理一万台服务器,没有 CMDB 做资产管理,后面确实会一团糟。

但在小规模场景下:

  • 一个运维工程师管 50 台服务器,他清楚每台服务器的用途
  • 他现在就想把监控跑起来,看到数据,解决眼前的问题
  • CMDB 对他来说,是"未来可能需要",但绝不是"现在必须有"

核心结论:为大规模设计的"正确架构",在小规模场景下变成了"使用门槛"。

洞察三:AI 带来新可能,工具还没跟上 🤖

大模型的出现,让我们看到了不同的可能:

  • 不需要再预先定义每一步
  • 告诉 AI “我要达到什么目标”,AI 自己去调用工具、处理异常、完成任务
  • 这不是自动化的升级版,这是交互方式的代际跃迁

但开源社区里,极少看到在设计之初就为"被 AI 调用"而设计的运维系统。

核心结论:AI 带来了新的可能,但运维工具还没准备好。


💡 三大价值主张

基于以上三个洞察,BlueKing Lite 提出了三个核心价值主张:

层级核心洞察 🔍价值主张 💡行业实践印证
资源约束是常态,不是例外算力贵、人才少、时间紧,大多数团队无法承受「重武器」方案🪶 轻量化神州控股「AI 控制塔」:3~4 人团队完成过去 10+ 人的项目交付,场景验证周期压缩至原来的 1/5 ~ 1/7
一步到位是幻想,平滑过渡才是现实企业无法一夜之间推翻现有系统,必须兼容存量、按需演进📈 渐进式远光软件「轻量化分布式人机协同」:个人端先配专属 AI 助手替代重复事务,企业端再逐步实现全局调度
AI 不是插件,是新引擎仅仅在旧流程里嵌入 AI 治标不治本,真正的突破来自以 AI 为中心重新设计流程、架构和组织🤖 AI FirstCreaoAI:10 人团队产出 99% AI 生成代码,一天内完成「上线→A/B 测试→下线→迭代再上线」全循环

📐 三者关系

轻量化 ──→ 渐进式 ──→ AI First
 (入门)      (路径)      (终局)
  • 轻量化降低门槛,让团队先跑起来;
  • 渐进式保证兼容性和可持续性,让转型不「翻车」;
  • AI First 是最终目标——不是给旧系统打补丁,而是让 AI 成为架构的中心。

1️⃣ 轻量化:在资源约束下重新设计 🪶

对比维度传统运维平台BlueKing Lite
内存要求128G+8G
CPU 要求16核+4核
实现方式裁剪功能重新设计架构
核心思路为大场景优化为小场景重构

💡 关键理解:这不是通过"裁剪功能"实现的轻量化,而是秉持"既然硬件约束变了,架构设计就要跟着变"的理念,通过选用和重新搭建更高效的组件,在降低资源占用的同时,依然能够跑通完整的运维功能。

2️⃣ 渐进式:从任何起点开始,按需演进 📈

传统平台强制"先建 CMDB,再装监控",假设用户的演进路径是统一的、可预设的。但现实是碎片化的:

  • 有人急需监控
  • 有人先要日志
  • 有人想做批量操作

BlueKing Lite 的做法:每个模块独立工作,从哪里开始都可以,按需演进。

🪶 BlueKing Lite:弱耦合

可选增强

可选增强

可选增强

可选增强

CMDB

监控

日志

作业

告警

🧱 传统平台:强耦合

CMDB

监控

告警

日志

作业

3️⃣ AI First:把工具设计成"AI 的工具箱" 🤖

传统模式中,工具是为了人而生:

  • 界面力求美观、操作舒适
  • 功能和交互逻辑基于人类使用习惯构建
  • AI 只是模拟人类操作图形界面

但工具的主要用户正在从人变成 AI。

BlueKing Lite 的设计思路是"工具迁就 AI":

  • 不是让 AI 学会使用人的工具
  • 而是让工具天然就能被 AI 理解
  • 运维工程师不再是工具的操作者,而是AI 的指挥者

🏗️ 整体架构设计

架构全景图

📥 数据采集层

💾 数据存储层

📡 消息总线层

⚙️ 业务服务层

🌐 网关层

👤 用户交互层

🏗️ 支撑平台

🔧 核心运维

🤖 智能运维

Web UI
Vue3 + bkui-vue

OpsPilot 智能对话
AI 原生界面

API Gateway

认证授权

OpsPilot
智能体引擎

MLOps
模型工厂

CMDB
配置管理

监控中心
Metrics

日志中心
Logs

告警中心
Alerts

作业管理
Jobs

补丁管理
Patch

节点管理
Node Mgmt

系统管理
System

控制台
Console

运营分析
Ops Analysis

ITSM
服务管理

NATS
服务总线

时序数据库
监控指标

日志引擎
日志数据

图数据库
CMDB关系

关系数据库
元数据

对象存储
S3

缓存
Redis

探针 Agent

Kubernetes

Prometheus

自定义上报

架构核心思路:90% 成熟技术栈 + 10% 创新 🧪

90%10%BlueKing Lite 技术投入比例成熟技术栈创新设计

90% 成熟技术栈 —— 站在巨人肩膀上:

  • 经典基础设施:S3、Redis、PostgreSQL/MySQL
  • 成熟数据链路:采集、监控、日志
  • 标准通信协议:NATS 消息总线
  • 容器编排:Docker / Kubernetes 部署

10% 创新 —— 核心价值所在:

  • 智能体服务模块(OpsPilot)
  • 弱耦合的模块关联设计
  • 边缘自治架构
  • AI 原生交互范式

技术栈一览

🤖 AI

💾 存储

📡 通信

⚙️ 后端

🎨 前端

Vue 3.5+

bkui-vue
蓝鲸组件库

TypeScript

Vite

Django

Python

DRF
REST API

NATS

WebSocket

HTTP/REST

PostgreSQL

时序数据库

日志引擎

图数据库

Redis

S3

大语言模型

知识图谱

Embedding

RAG 检索

监控服务

日志服务

CMDB服务

OpsPilot


Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐