-
LiquidAI/LFM2.5-ColBERT-350M
Sentence Similarity • 0.4B • Updated • 4.37k • 113 -
lightonai/GTE-ModernColBERT-v1
Sentence Similarity • 0.1B • Updated • 377k • • 175 -
lightonai/Reason-ModernColBERT
Sentence Similarity • 0.1B • Updated • 9.88k • • 250 -
lightonai/Agent-ModernColBERT
Sentence Similarity • 0.1B • Updated • 4.28k • • 34
AI & ML interests
In the following you find models tuned to be used for sentence / text embedding generation. They can be used with the sentence-transformers package.
Recent Activity
View all activity
A curated subset of the datasets that work out of the box with Sentence Transformers: https://huggingface.co/datasets?other=sentence-transformers
These datasets contain MS MARCO Triplets gathered by mining hard negatives using various models. Each dataset has various subsets.
-
sentence-transformers/msmarco-scores-ms-marco-MiniLM-L6-v2
Viewer • Updated • 241M • 172 • 3 -
sentence-transformers/msmarco-msmarco-distilbert-base-tas-b
Viewer • Updated • 86.3M • 1.06k • 5 -
sentence-transformers/msmarco-msmarco-distilbert-base-v3
Viewer • Updated • 88.9M • 1.11k • 5 -
sentence-transformers/msmarco-msmarco-MiniLM-L6-v3
Viewer • Updated • 80.6M • 806 • 3
NanoBEIR by Zeta Alpha, extended with BM25 scores. Used in the Sentence Transformers CrossEncoderNanoBEIREvaluator prior to ST version 5.2.
See https://huggingface.co/blog/multimodal-sentence-transformers
These datasets all have "english" and "non_english" columns for numerous datasets. They can be used to make embedding models multilingual.
-
sentence-transformers/parallel-sentences-wikititles
Viewer • Updated • 14.7M • 50 • 2 -
sentence-transformers/parallel-sentences-tatoeba
Viewer • Updated • 8.35M • 1.12k -
sentence-transformers/parallel-sentences-talks
Viewer • Updated • 19.6M • 2.2k • 12 -
sentence-transformers/parallel-sentences-europarl
Viewer • Updated • 49.7M • 380 • 1
These datasets are compatible with the (Sparse)NanoBEIREvaluator with Sentence Transformers v5.2+. Also CrossEncoderNanoBEIREvaluator if bm25 column
-
LiquidAI/LFM2.5-ColBERT-350M
Sentence Similarity • 0.4B • Updated • 4.37k • 113 -
lightonai/GTE-ModernColBERT-v1
Sentence Similarity • 0.1B • Updated • 377k • • 175 -
lightonai/Reason-ModernColBERT
Sentence Similarity • 0.1B • Updated • 9.88k • • 250 -
lightonai/Agent-ModernColBERT
Sentence Similarity • 0.1B • Updated • 4.28k • • 34
See https://huggingface.co/blog/multimodal-sentence-transformers
A curated subset of the datasets that work out of the box with Sentence Transformers: https://huggingface.co/datasets?other=sentence-transformers
These datasets all have "english" and "non_english" columns for numerous datasets. They can be used to make embedding models multilingual.
-
sentence-transformers/parallel-sentences-wikititles
Viewer • Updated • 14.7M • 50 • 2 -
sentence-transformers/parallel-sentences-tatoeba
Viewer • Updated • 8.35M • 1.12k -
sentence-transformers/parallel-sentences-talks
Viewer • Updated • 19.6M • 2.2k • 12 -
sentence-transformers/parallel-sentences-europarl
Viewer • Updated • 49.7M • 380 • 1
These datasets contain MS MARCO Triplets gathered by mining hard negatives using various models. Each dataset has various subsets.
-
sentence-transformers/msmarco-scores-ms-marco-MiniLM-L6-v2
Viewer • Updated • 241M • 172 • 3 -
sentence-transformers/msmarco-msmarco-distilbert-base-tas-b
Viewer • Updated • 86.3M • 1.06k • 5 -
sentence-transformers/msmarco-msmarco-distilbert-base-v3
Viewer • Updated • 88.9M • 1.11k • 5 -
sentence-transformers/msmarco-msmarco-MiniLM-L6-v3
Viewer • Updated • 80.6M • 806 • 3
These datasets are compatible with the (Sparse)NanoBEIREvaluator with Sentence Transformers v5.2+. Also CrossEncoderNanoBEIREvaluator if bm25 column
NanoBEIR by Zeta Alpha, extended with BM25 scores. Used in the Sentence Transformers CrossEncoderNanoBEIREvaluator prior to ST version 5.2.