Java 读取txt格式语料库并匹配指定字符串,如何可以快速完成?

发布于 2022-09-02 14:51:11 字数 700 浏览 21 评论 0

有一个9M多行的语料库,文件大小4G。现在需要匹配指定动词,符合句子条件的输出。
但是文件过大。每次读取一行。匹配下来要好久。请问有没有什么方法可以加快处理速度。

BufferedReader cpreader = new BufferedReader(new InputStreamReader(new FileInputStream(this.getCorpusPath())));
tring line = cpreader.readLine();
while(line != null)
            {
                ArrayList<String> verbList = new ArrayList();
                matcher_line = Pattern.compile("(.*\\%\\&\\$cook\\%\\&\\$VB.*)").matcher(line);
                if(matcher_line.find())
                {
                    System.out.println(line);
                }
                
                
                
                line = cpreader.readLine();
            }

如果你对这篇内容有疑问,欢迎到本站社区发帖提问 参与讨论,获取更多帮助,或者扫码二维码加入 Web 技术交流群。

扫码二维码加入Web技术交流群

发布评论

需要 登录 才能够评论, 你可以免费 注册 一个本站的账号。

评论(5

因为看清所以看轻 2022-09-09 14:51:11

读文件的话应该是没有问题的,不过你可以尝试改为缓冲式读取,因为一行的大小 可能是不确定的,会对效率造成影响吧。。
匹配的话如果是单个单词的话,可以改用更好的匹配方法,正则的话就不晓得了

酷遇一生 2022-09-09 14:51:11

你的程序是按行处理,单线程处理肯定慢,用多线程处理,每个线程处理一行,处理完后再请求处理下一行,读取行的话最好用缓存读取多行,然后再分配给多个线程处理,这样可以最大利用CPU。

安稳善良 2022-09-09 14:51:11

nio+多线程

十年不长 2022-09-09 14:51:11
Pattern.compile("(.*\\%\\&\\$cook\\%\\&\\$VB.*)")

这个在循环里边,每次都要编译正则,所以很慢,你把这个放到while外边看看

忘年祭陌 2022-09-09 14:51:11

AC自动机,构造的树大小应该不到4G,普通的笔记本都应该够了

~没有更多了~
我们使用 Cookies 和其他技术来定制您的体验包括您的登录状态等。通过阅读我们的 隐私政策 了解更多相关信息。 单击 接受 或继续使用网站,即表示您同意使用 Cookies 和您的相关数据。
原文