拥抱 PostgreSQL 支持 UI 配置化

yjhatfdu2

1 月 26 日

为什么不用 duckdb 呢？和 sqlite 一样是进程内数据库，但是是列存分析型数据库性能超强，存储效率也会比 pg 和 sqlite 高很多，存储体积小，也基本支持 postgresql 的语法，估计时间可以进一步缩短好几倍。

dog82

1 月 26 日

为啥把日志写到 DB 呢？

yjhatfdu2

1 月 26 日

@dog82 估计是便于分析聚合吧，不过存 pg 也确实是效率有点低了，我做的话可能会考虑存 parquet 文件用 duckdb 分析，这样文件可以存文件系统也可以存 s3 ，比较灵活，体积也非常小，10G 文件做到分钟级解析我也有信心

MagicCoder

1 月 26 日

@yjhatfdu2 好高级的词汇😂，我研究下 duckdb 之前没听过

concernedz

1 月 26 日

日志不是用 mongodb 么

yjhatfdu2

1 月 26 日

试了下，使用 golang 并行解析 11G 的 nginx accesslog ，同样适用 ip2region 解析地理位置，解析 useragent 字段，8 个线程，写入 parquet 文件，在我 m1max 老机器上可以在 40 秒左右完成。然后使用 duckdb 直接查询，7000 多万条数据，根据状态码 group by count 聚合大概 0.11 秒，还是非常适合这个场景的，整个 dashboard 尤其是只分析时间段的，应该秒级全出。
select count(*),status from 'parquet_out/*.parquet' group by status;
┌──────────────┬────────┐
│ count_star() │ status │
│ int64 │ int32 │
├──────────────┼────────┤
│ 16455120 │ 200 │
│ 420 │ 413 │
│ 58349130 │ 404 │
│ 261330 │ 400 │
│ 8310 │ 500 │
│ 60 │ 408 │
│ 3540 │ 501 │
│ 3537120 │ 405 │
│ 90 │ 403 │
│ 7230 │ 206 │
│ 15630 │ 304 │
│ 4980 │ 499 │
├──────────────┴────────┤
│ 12 rows 2 columns │
└───────────────────────┘
Run Time (s): real 0.112 user 0.937740 sys 0.047321

yjhatfdu2

1 月 26 日

然后使用 create table access_log as select * from 'parquet_out/*.parquet'; 创建 duckdb 的表并导入 parquet 的所有数据，耗时 20 秒，之后查询可以再快一倍，最终 duckdb 存储 7000 多万条记录占用硬盘 1.9G ，原始 access.log 一共 11G

MagicCoder

1 月 26 日

@yjhatfdu2 卧槽这性能可以

yjhatfdu2

1 月 26 日

我看了下，你这里用了大量的维度表、预聚合、分表来提高性能，其实用 duckdb 性能足够，单机 10 亿条都用不着干这些事。可以极大的简化后端，减少存储占用和提高解析和写入速度

MagicCoder

1 月 26 日

@yjhatfdu2 对的，我后端做了大量的优化工作提升性能，感觉 duckdb 确实可行😂

MagicCoder

1 月 26 日

@yjhatfdu2 之前朋友还给我推荐过 clickhouse ，我就是看他太耗费资源了，我这个场景还用不到

yjhatfdu2

1 月 26 日

@MagicCoder clickhouse 性能上也是可以的，但是部署维护复杂，稍微老点的版本对于 update/delete 效率非常低，资源消耗也是很高。duckdb 适合直接平替 sqlite ，单机模式下很适合。当然你这里如果需要初始化也做的非常快，还是需要做一些工程优化的，如果是 duckdb 直接使用 golang 的驱动，使用 appender 接口进行写入，这个场景也就 20-30w 行一秒，我是尝试了直接使用 go-parquet ，每个线程独立直接写入 parquet 文件，最后再用 duckdb 执行 sql 直接导入，后续再使用 go 的 database/sql 接口写入增量数据，这样才能做到初始化的极速、后续处理的方便。

MagicCoder

1 月 26 日

@yjhatfdu2 懂了，非常感谢，我研究下你说的这个方案

XyIsMy

1 月 26 日

@MagicCoder duckdb ，可以直接在 postgresql 上面装一个扩展，开启扩展，会自动转换成 duckdb ，也很方便

MagicCoder

1 月 26 日

@XyIsMy 哦豁，这么高级，那就方便很多了

goodryb

1 月 26 日

OP 这下又有活可以干了，等你下个稳定版出来了我试试

Hermitist

1 月 26 日

我也在等 OP 的更新, 冒昧问下, 用你的项目在一个暂时免费, 但以后商业化的软件有什么问题吗?

MagicCoder

1 月 26 日

@Hermitist 没事，随便用

MagicCoder

1 月 26 日

@goodryb 行别忘了🤣

yjhatfdu2

1 月 26 日

@MagicCoder duckdb 的 pg_duckdb 插件并不是很适合。首先，你还是需要 pg ，pg 需要单独部署，不能集成到应用里面，作为轻量化的，必然增加了部署的复杂度。第二，pg 需要部署 pg_duckdb 插件需要自行编译或者使用特定的发行版，还是有一定复杂度的。第三，pg_duckdb 主要是方便使用 pg 访问、查询外部 parquet 等文件，或者联合 pg 本地表进行分析查询。但是还是需要走 pg 的协议、parser 等，也没法直接写入 duckdb 自己的库，对于现在这个场景降低了性能，提高了复杂度。

拥抱 PostgreSQL 支持 UI 配置化

前言

抛弃 SQLite

UI 配置可视化使用

新增 wiki 文档

访问明细模块优化

概况模块优化

项目地址

写在最后