帮助中心 / 第 2 步

如何创建数据源和业务信息

接入数据库、同步表结构、向量化,再补齐业务语义,让系统真正读懂你的数据。

这一步决定了问数的准确率。只连上数据库是不够的——系统还需要知道哪些表可用、每个字段是什么业务含义。整个流程有四步,顺序不能颠倒。

第一步:接入数据库

进入 数据源管理,点击新建,填写连接信息:

字段 说明
数据源名称 建议用业务域命名,比如「销售订单库」而不是 IP 或端口号
数据库类型 见下方支持列表
主机地址 / 端口 数据库连接地址
数据库名 要分析的库
Schema PostgreSQL、Oracle、SQL Server 等需要填;MySQL、ClickHouse 留空
用户名 / 密码 强烈建议使用只读账号

平台支持 8 类数据库:

数据源名称会影响自动路由。 当你有多个数据源时,系统按问题语义匹配最合适的库。名字叫「销售订单库」比叫「145」更容易被正确命中。

第二步:选表同步

进入 表结构管理,选择刚建好的数据源,点击选表,勾选需要参与分析的表。

不要把整库都同步进来。 只勾选业务分析真正会用到的表——表越少,检索越准,生成的 SQL 也越稳。系统表、日志表、临时表都应排除。

第三步:向量化

同步后的表会显示 已同步 标签,但此时还不能被语义检索命中。需要在表详情页点击 向量化,处理完成后标签变为 已向量化

这一步会把表名、字段名、注释转成向量。没有向量化的表,提问时系统检索不到,等于白同步。

第四步:补齐业务语义

到这里系统认识表结构了,但还不认识业务。以下三处按需补充:

业务语义层 —— 自动从表结构和数据分布中提取业务信息(指标、维度、枚举映射、表间关系)。选择数据源后发起生成任务,可以看到进度和每张表的生成状态。这是投入产出比最高的一步。

业务术语 —— 录入公司内部的黑话和口径定义。比如「大客户」指年消费额 50 万以上、「有效订单」要排除退款单。系统提问时会自动带上匹配的术语解释。

SQL 示例 —— 录入典型问题和对应的正确 SQL。这是纠正口径最直接的手段:当某类问题总是生成错误的 SQL 时,补一条示例通常立刻见效。

检查清单

配置完成后,确认:

接下来:如何创建 Agent 和分享给团队