Enhanced Simple tokenizer

本项目是基于开源项目 "simple" fork而来(simple 是一个支持中文和拼音的 sqlite3 fts5 拓展)，在simple的基础上做了一些增强, 核心改动集中在 Query Parser 和 Tokenizer 2部分，包含以下：

增强了中文拼音搜索，使用open-pinyin作为外部的拼音query parser，修复了存在的一些bug，也使得拼音搜索更灵活，强大 (https://github.com/chrwhy/open-pinyin)
增加了中文简繁体归一化，实现中文简繁体搜索
增加了数字的前缀+后缀分词（比如：手机号支持从号码起始位置搜索，也支持尾号搜索）
增加了英文的前缀分词
增加了一个规则简明的query parser
在 go example中增加了 REPL demo作为测试工具，提升开发测试效率

除了核心tokenizer的改动，其余的实现在./examples/go中

致敬原作者 @wangfenjin

致敬原作者开源了一个优秀的项目, 以下为原项目的README，也可以移步 https://github.com/wangfenjin/simple 查看原项目

Simple tokenizer

simple 是一个支持中文和拼音的 sqlite3 fts5 拓展。它完整提供了微信移动端的全文检索多音字问题解决方案一文中的方案四，非常简单和高效地支持中文及拼音的搜索。

实现相关介绍：https://www.wangfenjin.com/posts/simple-tokenizer/

在此基础上，我们还支持通过 cppjieba 实现更精准的词组匹配，介绍文章见 https://www.wangfenjin.com/posts/simple-jieba-tokenizer/

用法

代码使用

下载已经编译好的插件：https://github.com/wangfenjin/simple/releases 参考 examples 目录，目前已经有 c++, python, go 和 node-sqlite3 的例子。
iOS可以参考:
- #73
- @hxicoder 提供的 demo
- @pipi32167提供的demo
在 Rust 中使用的例子 wangfenjin#89 https://github.com/fundon/tiny-docs-se
Java 例子 https://github.com/wangfenjin/sqlite-java-connect
C# 例子 https://github.com/dudylan/SqliteCheck/
Rust 例子 https://github.com/xuxiaocheng0201/libsimple/
Android Flutter 的例子 https://github.com/SageMik/sqlite3_simple

命令行使用

首先需要确认你用到的 sqlite 版本支持 fts5 拓展，确认方法是：

select fts5(?1);

然后就可以使用了，具体的例子可以参考 example.sql 和 cpp

$ ./sqlite3
SQLite version 3.32.3 2020-06-18 14:00:33
Enter ".help" for usage hints.
Connected to a transient in-memory database.
Use ".open FILENAME" to reopen on a persistent database.
sqlite> .load libsimple
sqlite> CREATE VIRTUAL TABLE t1 USING fts5(text, tokenize = 'simple');
sqlite> INSERT INTO t1 VALUES ('中华人民共和国国歌');
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华国歌');
[中华]人民共和[国国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华国歌');
[中华]人民共和国[国歌]
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match simple_query('中华人民共和国');
[中华人民共和国国]歌
sqlite> select simple_highlight(t1, 0, '[', ']') as text from t1 where text match jieba_query('中华人民共和国');
[中华人民共和国]国歌

功能

simple tokenizer 支持中文和拼音的分词，并且可通过开关控制是否需要支持拼音
simple_query() 函数实现自动组装 match query 的功能，用户不用学习 fts5 query 的语法
simple_highlight() 实现连续高亮 match 的词汇，与 sqlite 自带的 highlight 类似，但是 simple_highlight 实现了连续 match 的词汇分到同一组的逻辑，理论上用户更需要这样
simple_highlight_pos() 实现返回 match 的词汇位置，用户可以自行决定怎么使用
simple_snippet() 实现截取 match 片段的功能，与 sqlite 自带的 snippet 功能类似，同样是增强连续 match 的词汇分到同一组的逻辑
jieba_query() 实现jieba分词的效果，在索引不变的情况下，可以实现更精准的匹配。可以通过 -DSIMPLE_WITH_JIEBA=OFF 关掉结巴分词的功能 #35
jieba_dict() 指定 dict 的目录，只需要调用一次，需要在调用 jieba_query() 之前指定。

开发

编译相关

使用支持 c++14 以上的编译器编译，直接在根目录 ./build-and-run 就会编译所有需要的文件并运行测试。编译输出见 output 目录

也可以手动 cmake:

mkdir build; cd build
cmake ..
make -j 12
make install

支持 iOS 编译：

./build-ios.sh

代码

src/entry 入口文件，注册 sqlite tokenizer 和函数
src/simple_tokenizer 分词器实现
src/simple_highlight 高亮函数，基于内置的高亮函数改的，让命中的相邻单词连续高亮
src/pinyin 中文转拼音以及拼音拆 query 的实现

TODO

添加 CI/CD
添加使用的例子，参见 cpp python3
部分参数可配，比如拼音文件的路径(已经把文件打包到 so 中)
减少依赖，减小 so 的大小
给出性能数据：加载扩展时间2ms内；第一次使用拼音功能需要加载拼音文件，大概 500ms；第一次使用结巴分词功能需要加载结巴分词文件，大概 4s。

Name		Name	Last commit message	Last commit date
Latest commit History 166 Commits
.github		.github
contrib		contrib
examples		examples
src		src
test		test
vcpkg @ 501db0f		vcpkg @ 501db0f
.clang-format		.clang-format
.gitattributes		.gitattributes
.gitignore		.gitignore
.gitmodules		.gitmodules
CMakeLists.txt		CMakeLists.txt
CMakePresets.json		CMakePresets.json
LICENSE		LICENSE
README.md		README.md
build-and-run		build-and-run
build-and-run-no-jieba		build-and-run-no-jieba
build-ios.sh		build-ios.sh
build.bat		build.bat
example-jieba.sql		example-jieba.sql
example.sql		example.sql

Provide feedback

Saved searches

Use saved searches to filter your results more quickly

Repository files navigation

Enhanced Simple tokenizer

本项目是基于开源项目 "simple" fork而来(simple 是一个支持中文和拼音的 sqlite3 fts5 拓展)，在simple的基础上做了一些增强, 核心改动集中在 Query Parser 和 Tokenizer 2部分，包含以下：

致敬原作者 @wangfenjin

致敬原作者开源了一个优秀的项目, 以下为原项目的README，也可以移步 https://github.com/wangfenjin/simple 查看原项目

Simple tokenizer

用法

代码使用

命令行使用

功能

开发

编译相关

代码

TODO

Star History

About

Releases 1

Packages

Languages

License

chrwhy/simple

Folders and files

Latest commit

History

Repository files navigation

Enhanced Simple tokenizer

本项目是基于开源项目 "simple" fork而来(simple 是一个支持中文和拼音的 sqlite3 fts5 拓展)，在simple的基础上做了一些增强, 核心改动集中在 Query Parser 和 Tokenizer 2部分，包含以下：

致敬原作者 @wangfenjin

致敬原作者开源了一个优秀的项目, 以下为原项目的README，也可以移步 https://github.com/wangfenjin/simple 查看原项目

Simple tokenizer

用法

代码使用

命令行使用

功能

开发

编译相关

代码

TODO

Star History

About

Resources

License

Stars

Watchers

Forks

Releases 1

Packages 0

Languages

Packages