NLP Citations — Topic
246 Entries
Topic Index
Needs-Review
A
Aho-Corasick
Analysis Chain
Analyzer
ANCE
Approximate Nearest Neighbour
ASCII Folding
Atlas
Attention Mechanism
B
Beider-Morse Phonetic Matching
BEIR
BERT
BERTScore
Bi-Encoder
Bigram
Binary Embeddings
BLEU Score
Bloom Filter
BM25
Ranking
BM25+
BM25F
Boolean Retrieval
Boosting
Burrows-Wheeler Transform
Byte Pair Encoding
C
Case Folding
Causal Language Model
Caverphone
Character N-Gram
Chunking
Chunking Strategy
CJK Tokeniser
Cloze Task
Co-occurrence Matrix
ColBERT
ColBERTv2
Collocation
Cologne Phonetics
Commit
Context Window
Contrastive Loss
Contriever
Coreference Resolution
Corpus
Corpus Annotation
Cosine Similarity
Similarity
Cross-Encoder
Cross-Entropy
D
Daitch-Mokotoff Soundex
Damerau-Levenshtein Distance
Decimal Digit Filter
Decompounding
DeepImpact
Dense Retrieval
Dependency Parsing
Dice Coefficient
DocT5Query
Document Frequency
DocValues
Domain-Specific Stop Words
Dot Product Similarity
Double Metaphone
DPR (Dense Passage Retrieval)
DRMM
DSI (Differentiable Search Index)
DSSM
DUET
E
F
F1 Score
FAISS
fastText
Few-Shot Learning
FiD (Fusion-in-Decoder)
Field Type
Fine-Tuning
Finite State Transducer
FM-Index
Forward Index
Fuzzy Query
G
H
Hallucination
Hamming Distance
Hapax Legomenon
Hard Negative Mining
Heaps' Law
HNSW
HTML Strip
Hunspell
Hybrid Search
HyDE
I
ICU Tokeniser
In-Batch Negatives
Index-time Analysis
Inflection
Instruction Tuning
Inverse Document Frequency
Inverted Index
IVF Index
J
K
L
Lancaster Stemmer
Language Model
Learning to Rank
Lemmatisation
Length Filter
Levenshtein Distance
Similarity
Listwise Ranking Loss
LLM Rerankers (RankGPT)
Locality-Sensitive Hashing
Longest Common Subsequence
Longest Common Substring
Lovins Stemmer
Lowercasing
M
Masked Language Model
Match Rating Approach
Matryoshka Representation Learning
Mean Average Precision
Mean Reciprocal Rank
Merge Policy
Metaphone
Metaphone 3
MinHash
Minimum Should Match
MonoBERT
MonoT5
More Like This
Morphological Analysis
MS MARCO
Multi-Head Attention
N
N-Gram
Tokenisation
N-Gram Language Model
Named Entity Recognition
NDCG
Needleman-Wunsch
Normalisation
NYSIIS
O
P
PACRR
Paice/Husk Stemmer
Part-of-Speech Tagging
Path Hierarchy Tokeniser
Pattern Replace Filter
Perplexity
Phonetic Encoding
Phrase Query
PLAID
Pointwise Mutual Information
Porter Stemmer
Porter2 Stemmer
Positional Encoding
Positional Index
Posting
Postings List
Retrieval
Precision
Precision at k
Prefix Query
Probabilistic Retrieval Model
Product Quantisation
Prompt Engineering
Proximity Query
Punctuation Tokeniser
Q
R
Range Query
RankT5
REALM
Recall
Regex Tokeniser
Relevance Judgement
Reranker
Retrieval-Augmented Generation
RLHF
Roaring Bitmap
ROUGE
S
Segment
Self-Attention
Sentence Boundary Detection
Sentence Embedding
Sentence Tokeniser
SentencePiece
Sequence-to-Sequence
Shingle
Shingling
SimCSE
SimHash
Skip List
Skip-Gram
Smith-Waterman
Snowball Stemmer
Soundex
Span Query
Sparse Retrieval
SPLADE
Stemming
Stop List
Stop Word
Stop Word Filter
Stored Field
Subword Tokenisation
Succinct Data Structure
Suffix
Suffix Array
Suffix Tree
Synonym Expansion
T
TAS-B
Term Frequency
Term Vector
Text Classification
TF-IDF
Thai Tokeniser
Token
Tokenisation
Tokeniser Vocabulary
Transformer
Trie
Trigram
Trigram Similarity
Trim Filter
Two-Stage Retrieval
Type
U
V
W
Z