Porter Stemmer算法问题

发布于 2024-10-01 07:17:05 字数 240 浏览 5 评论 0原文

我正在实现一个搜索应用程序。语料库是大型文本文档。在文件处理过程中，我对所有单词进行标记并调用 Porter Stemmer 算法步骤1（http://tartarus.org/~martin/PorterStemmer/csharp2.txt）。

第 1 步去掉了复数和 -ed 或 -ing...

我注意到像“this”这样的词将被词干为“thi”。

这是算法的正常运行吗？因为我想标记“this”这个词。

原文

分享到QQ

分享到微博

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

需要登录才能够评论，你可以免费注册一个本站的账号。

花想c 2024-10-08 07:17:05

根据您的描述，我的预感是 this 在 Porter Stemmer 算法中被视为复数形式并简化为 thi。

我在 Porter 的论文中没有找到对以 s 结尾的非复数单词的明确引用。

http://tartarus.org/~martin/PorterStemmer/def.txt

回复收藏 0 原文

~没有更多了~

关于作者

汹涌人海

暂无简介

0 文章

0 评论

25 人气

关注发私信

胡图图

文章 0 评论 0

关注

zt006

文章 0 评论 0

关注

z祗昰~

文章 0 评论 0

关注

冰葑

文章 0 评论 0

关注

野の

文章 0 评论 0

关注

天空

文章 0 评论 0

友情链接

文江博客

Porter Stemmer算法问题

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（1）

关于作者

相关话题

热门标签

推荐作者

胡图图

zt006

z祗昰~

冰葑

野の

天空

友情链接

Porter Stemmer算法问题

如果你对这篇内容有疑问，欢迎到本站社区发帖提问 参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（1）

关于作者

相关话题

热门标签

推荐作者

胡图图

zt006

z祗昰~

冰葑

野の

天空

友情链接

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。