TG规则脚本信息分享器 头像

消息来源频道

TG规则脚本信息分享器

@MRHXPJGG

频道10,252 位成员公开可见0 人在线

🏳️‍🌈分享主题:包括但不限于关于机场、政治、吹水、不露点NSFW等…同时讨论任何有关捷径规则、JSBOX脚本、APP STORE旧版本抓包下载、付费软件破解、开车软件分享和破解VIP等…本频道所有内容基本为搬运,侵删。 🌟投稿机器人: @TGJSD_bot 🍪解封申诉: 联系群组管理 🦁本频道观点带有强烈主观色彩,不喜勿关注,建议退订。 群组频道:https://t.me/MRHXPJ

成员规模10,252 位成员
在线情况0 人在线
消息总数11,329 条消息
浏览量总数47,329 次浏览

在这个频道里搜索消息……

t.me/MRHXPJGG

#telegram #Search
🔍 为什么 Telegram 不能搜寻中文讯息
⭕️ 圈重点:
- Telegram 使用 SQLite 作为资料库
- fts 全文搜索将字串以 Tokenizer 切割成短语,分别取 Hash,寻找时与哈希表进行比对
- 标记生成器根据分离器、分隔符切割字串
- 分离器、分隔符之外的成分为「令牌」,有“大号(字母),N (数字)及Co(其他)”三种预设
- 中日韩文字属于 unicode CJK,绝大多数被识别为令牌
(╯﹏╰) 从而,汉字语汉字间没有任何分隔符,会被整串拿去哈希,从而导致搜寻无效。本文从代码的角度很好地说明了 Telegram 的中文消息搜索为何如此之烂
👨🏻‍💻 作者给了两个建议:
1️⃣ 手动在汉字间插入不可见的分离器
2️⃣ 写个客制化的 Tokenizer,即魔改 Telegram 客户端软件
❤️ 感谢群友分享此文,之前自留地也通过不同的思路整理了中文搜索方案,并认为目前的最优解是通过全局爬虫+数据库索引实现:Telegram 中文搜索方案探索
频道:@NewlearnerChannel
消息来源: https://t.me/NewlearnerChannel/4551