Skip to content
/ simple Public
forked from wangfenjin/simple

支持中文和拼音的 SQLite fts5 全文搜索扩展 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin

License

Notifications You must be signed in to change notification settings

chrwhy/simple

 
 

Repository files navigation

Enhanced Simple tokenizer

本项目是基于开源项目 "simple" fork而来(simple 是一个支持中文和拼音的 sqlite3 fts5 拓展),在simple的基础上做了一些增强, 核心改动集中在 Query Parser 和 Tokenizer 2部分,包含以下:

  1. 增强了中文拼音搜索,使用open-pinyin作为外部的拼音query parser,修复了存在的一些bug,也使得拼音搜索更灵活,强大 (https://github.com/chrwhy/open-pinyin)
  2. 增加了中文简繁体归一化,实现中文简繁体搜索
  3. 增加了数字的前缀+后缀分词(比如:手机号支持从号码起始位置搜索,也支持尾号搜索)
  4. 增加了英文的前缀分词
  5. 增加了一个规则简明的query parser
  6. 在 go example中增加了 REPL demo作为测试工具,提升开发测试效率

除了核心tokenizer的改动,其余的实现在./examples/go中

致敬原作者 @wangfenjin

致敬原作者开源了一个优秀的项目, 以下为原项目的README,也可以移步 https://github.com/wangfenjin/simple 查看原项目

Simple tokenizer

simple 是一个支持中文和拼音的 sqlite3 fts5 拓展。它完整提供了 微信移动端的全文检索多音字问题解决方案 一文中的方案四,非常简单和高效地支持中文及拼音的搜索。

实现相关介绍:https://www.wangfenjin.com/posts/simple-tokenizer/

在此基础上,我们还支持通过 cppjieba 实现更精准的词组匹配,介绍文章见 https://www.wangfenjin.com/posts/simple-jieba-tokenizer/

用法

代码使用

命令行使用

首先需要确认你用到的 sqlite 版本支持 fts5 拓展,确认方法是:

select fts5(?1);

然后就可以使用了,具体的例子可以参考 example.sqlcpp

$ ./sqlite3
SQLite version 3.32.3 2020-06-18 14:00:33
Enter ".help" for usage hints.
Connected to a transient in-memory database.
Use ".open FILENAME" to reopen on a persistent database.
sqlite> .load libsimple
sqlite> CREATE VIRTUAL TABLE t1 USING fts5(text, tokenize = 'simple');
sqlite> INSERT INTO t1 VALUES ('中华人民共和国国歌');
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华国歌');
[中华]人民共和[国国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华国歌');
[中华]人民共和国[国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华人民共和国');
[中华人民共和国国]歌
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华人民共和国');
[中华人民共和国]国歌

功能

  1. simple tokenizer 支持中文和拼音的分词,并且可通过开关控制是否需要支持拼音
  2. simple_query() 函数实现自动组装 match query 的功能,用户不用学习 fts5 query 的语法
  3. simple_highlight() 实现连续高亮 match 的词汇,与 sqlite 自带的 highlight 类似,但是 simple_highlight 实现了连续 match 的词汇分到同一组的逻辑,理论上用户更需要这样
  4. simple_highlight_pos() 实现返回 match 的词汇位置,用户可以自行决定怎么使用
  5. simple_snippet() 实现截取 match 片段的功能,与 sqlite 自带的 snippet 功能类似,同样是增强连续 match 的词汇分到同一组的逻辑
  6. jieba_query() 实现jieba分词的效果,在索引不变的情况下,可以实现更精准的匹配。可以通过 -DSIMPLE_WITH_JIEBA=OFF 关掉结巴分词的功能 #35
  7. jieba_dict() 指定 dict 的目录,只需要调用一次,需要在调用 jieba_query() 之前指定。

开发

编译相关

使用支持 c++14 以上的编译器编译,直接在根目录 ./build-and-run 就会编译所有需要的文件并运行测试。编译输出见 output 目录

也可以手动 cmake:

mkdir build; cd build
cmake ..
make -j 12
make install

支持 iOS 编译:

./build-ios.sh

代码

  • src/entry 入口文件,注册 sqlite tokenizer 和函数
  • src/simple_tokenizer 分词器实现
  • src/simple_highlight 高亮函数,基于内置的高亮函数改的,让命中的相邻单词连续高亮
  • src/pinyin 中文转拼音以及拼音拆 query 的实现

TODO

  • 添加 CI/CD
  • 添加使用的例子,参见 cpp python3
  • 部分参数可配,比如拼音文件的路径(已经把文件打包到 so 中)
  • 减少依赖,减小 so 的大小
  • 给出性能数据:加载扩展时间2ms内;第一次使用拼音功能需要加载拼音文件,大概 500ms;第一次使用结巴分词功能需要加载结巴分词文件,大概 4s。

Star History

Star History Chart

About

支持中文和拼音的 SQLite fts5 全文搜索扩展 | A SQLite3 fts5 tokenizer which supports Chinese and PinYin

Resources

License

Stars

Watchers

Forks

Packages

No packages published

Languages

  • C++ 82.3%
  • CMake 9.9%
  • Shell 7.6%
  • Batchfile 0.2%