N-gram
N-gram je definován jako sled n po sobě jdoucích položek z dané posloupnosti. Ze sémantického pohledu může být tato posloupnost buď posloupností slov nebo písmen, nebo čehokoli jiného. V praxi se častěji vyskytují n-gramy jako sled slov. Sled dvou po sobě jdoucích slov bývá často označován jako bigram, pro sled tří položek je zažitý pojem trigram. Od čtyř a výše se používá označení n-gram, kde n je nahrazeno počtem za sebou jdoucích elementů. Při řešení úloh z oblasti počítačového zpracování přirozeného jazyka se na reprezentaci textu využívají ve většině případů slova nebo n-gramy slov.
This article is issued from Wikipedia. The text is licensed under Creative Commons - Attribution - Sharealike. Additional terms may apply for the media files.