约 192GB 短信样本如何标记分类?

1次阅读

共计 250 个字符,预计需要花费 1 分钟才能阅读完成。

之前开发了一个《垃圾短信过滤 App》- 胖鱼信使

为什么要重新造轮子?

主要是 2 个原因:
1: 市面上没有 完全不联网 的垃圾短信过滤 App
2: 想学习一下人工智能分类

192.36 GB 纯文本短信数据

上架研发初期,垃圾短信的训练样本都是来自互联网,然后加上自己和家人的几百条数据,

偶尔有用户会给我回馈几条,还能处理。

后来想更提高一把模型准确性,想多搞点样本,有个用户提供了这些个短信数据。

192,184,722,019 字节(磁盘上的 192.36 GB)

纯文本数据,这也太多了。。。。

有什么工具能对其进行批量标注吗?

正文完
 0