帮助中心 / 第 2 步
如何创建数据源和业务信息
接入数据库、同步表结构、向量化,再补齐业务语义,让系统真正读懂你的数据。
这一步决定了问数的准确率。只连上数据库是不够的——系统还需要知道哪些表可用、每个字段是什么业务含义。整个流程有四步,顺序不能颠倒。
第一步:接入数据库
进入 数据源管理,点击新建,填写连接信息:
| 字段 | 说明 |
|---|---|
| 数据源名称 | 建议用业务域命名,比如「销售订单库」而不是 IP 或端口号 |
| 数据库类型 | 见下方支持列表 |
| 主机地址 / 端口 | 数据库连接地址 |
| 数据库名 | 要分析的库 |
| Schema | PostgreSQL、Oracle、SQL Server 等需要填;MySQL、ClickHouse 留空 |
| 用户名 / 密码 | 强烈建议使用只读账号 |
平台支持 8 类数据库:
- 通用:MySQL、PostgreSQL、Oracle、SQL Server
- 分析型:ClickHouse
- 信创:达梦 DM、人大金仓 KingbaseES、openGauss
数据源名称会影响自动路由。 当你有多个数据源时,系统按问题语义匹配最合适的库。名字叫「销售订单库」比叫「145」更容易被正确命中。
第二步:选表同步
进入 表结构管理,选择刚建好的数据源,点击选表,勾选需要参与分析的表。
不要把整库都同步进来。 只勾选业务分析真正会用到的表——表越少,检索越准,生成的 SQL 也越稳。系统表、日志表、临时表都应排除。
第三步:向量化
同步后的表会显示 已同步 标签,但此时还不能被语义检索命中。需要在表详情页点击 向量化,处理完成后标签变为 已向量化。
这一步会把表名、字段名、注释转成向量。没有向量化的表,提问时系统检索不到,等于白同步。
第四步:补齐业务语义
到这里系统认识表结构了,但还不认识业务。以下三处按需补充:
业务语义层 —— 自动从表结构和数据分布中提取业务信息(指标、维度、枚举映射、表间关系)。选择数据源后发起生成任务,可以看到进度和每张表的生成状态。这是投入产出比最高的一步。
业务术语 —— 录入公司内部的黑话和口径定义。比如「大客户」指年消费额 50 万以上、「有效订单」要排除退款单。系统提问时会自动带上匹配的术语解释。
SQL 示例 —— 录入典型问题和对应的正确 SQL。这是纠正口径最直接的手段:当某类问题总是生成错误的 SQL 时,补一条示例通常立刻见效。
检查清单
配置完成后,确认:
- 数据源连接测试通过
- 需要的表都已同步,且状态为
已向量化 - 业务语义层生成任务显示成功
- 公司特有口径已录入业务术语