如何使用 inltk 标记印度语言

发布于 2025-01-09 14:54:44 字数 514 浏览 4 评论 0原文

我使用这个 NLP 文档做到了这一点，请查看： https://inltk.readthedocs.io/en/latest/index.html

from inltk.inltk import tokenize 
text="जो मुझको सताती है तुझे वो बातें आती है जब सामने तू होता नहीं बेचैनी बढ़ जाती है मैं रूठ "
tokenize(text ,'hi')

错误是：

RuntimeError: Internal: src/sentencepiece_processor.cc(890)
[model_proto->ParseFromArray(serialized.data(), serialized.size())]

原文

i did this using this NLP documentation check it out:
https://inltk.readthedocs.io/en/latest/index.html

from inltk.inltk import tokenize 
text="जो मुझको सताती है तुझे वो बातें आती है जब सामने तू होता नहीं बेचैनी बढ़ जाती है मैं रूठ "
tokenize(text ,'hi')

the error is:

RuntimeError: Internal: src/sentencepiece_processor.cc(890)
[model_proto->ParseFromArray(serialized.data(), serialized.size())]

分享到QQ

分享到微博

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

需要登录才能够评论，你可以免费注册一个本站的账号。

我早已燃尽 2025-01-16 14:54:45

您遇到的问题通常是在使用了错误的 SPM 模型或存在与 SPM 模型相关的任何其他问题时出现的。

确保首先设置语言支持：

from inltk.inltk import setup
setup('hi')

The issue you encountered usually appears when a wrong SPM model is used, or when there is any other issue related to SPM model.

Make sure you set up the language support first:

from inltk.inltk import setup
setup('hi')

回复收藏 0 原文

~没有更多了~

关于作者

时光礼记

暂无简介

文章

29 人气

关注发私信

达拉崩吧

文章 0 评论 0

关注

PANGOO

文章 0 评论 0

关注

kkgtx

文章 0 评论 0

关注

WordPress小学生

文章 0 评论 0

关注

酷炫老祖宗

文章 0 评论 0

关注

硪扪都還晓

文章 0 评论 0

友情链接

文江博客

如何使用 inltk 标记印度语言

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（1）

关于作者

相关话题

热门标签

推荐作者

达拉崩吧

PANGOO

kkgtx

WordPress小学生

酷炫老祖宗

硪扪都還晓

友情链接

如何使用 inltk 标记印度语言

如果你对这篇内容有疑问，欢迎到本站社区发帖提问 参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。

发布评论

评论（1）

关于作者

相关话题

热门标签

推荐作者

达拉崩吧

PANGOO

kkgtx

WordPress小学生

酷炫老祖宗

硪扪都還晓

友情链接

如果你对这篇内容有疑问，欢迎到本站社区发帖提问参与讨论，获取更多帮助，或者扫码二维码加入 Web 技术交流群。