detectCharset
s— 要分析的文本。String
String
示例
基本用法
Query
Response
detectLanguage
text_to_be_analyzed— 要分析的文本。String
un = 未知,无法检测出任何语言;other = 检测到的语言没有 2 字母代码。String
示例
混合语言文本
Query
Response
detectLanguageMixed
detectLanguage 函数类似,但 detectLanguageMixed 返回一个 Map,其中 2 字母语言代码映射为相应语言在文本中所占的百分比。
语法
s— 要分析的文本String
Map(String, Float32)
示例
混合语言
Query
Response
detectLanguageUnknown
detectLanguage 函数类似,不同之处在于 detectLanguageUnknown 函数可处理非 UTF8 编码的字符串。
当字符集为 UTF-16 或 UTF-32 时,建议优先使用此版本。
语法
s— 要分析的文本。String
un = 未知,无法检测到任何语言;other = 检测到的语言没有 2 字母代码。String
示例
基本用法
Query
Response
detectTonality
限制此函数当前版本的限制在于,它使用内置情感字典,且仅适用于俄语。
s— 要分析的文本。String
Float32
示例
俄语情感分析
Query
Response
lemmatize
String
示例
英语词形还原
Query
Response
stem
word— 要进行词干提取的单个小写单词 (或单词数组) 。必须使用小写——大写字符会产生未定义的结果。接受 String、FixedString、Array(String)、Array(FixedString)、Array(Nullable(String)) 或 Array(Nullable(FixedString))。String或FixedString或Array(String)或Array(FixedString)language— 要应用其词干提取规则的语言。规范标识符列在 system.stemmers 中 (例如 ‘english’、‘german’、‘porter’)。Snowball 也接受 2 字母或 3 字母的 ISO 639 代码 (例如 ‘en’、‘eng’) 作为已定义的别名,但不同语言的支持范围有所差异——为保证可移植性,建议优先使用system.stemmers中列出的名称。String
String 或 Array(String)
示例
对单个单词进行词干提取
Query
Response
Query
Response
Query
Response
Query
Response
synonyms
plainwordnet
plain 扩展类型时,需要提供一个简单文本文件的路径,其中每一行对应一个特定的同义词集合。
该行中的词语必须以空格或制表符分隔。
使用 wordnet 扩展类型时,需要提供一个包含 WordNet 词库的目录路径。
该词库必须包含 WordNet 词义索引。
语法
Array(String)
示例
查找同义词
Query
Response