sergeyzh/rubert-tiny-retriever

🤗 Hugging Face 来源sentence-similaritymit29M 参数117 MBsafetensors✓ 1 个校验和今天更新
一条命令提交

在你的模型文件夹旁边运行它。它会制作种子、将文件与 Hugging Face 比对,然后提交。你只需开始做种,并粘贴你账户中的密钥。它只读取你的文件,绝不修改。如果愿意,可以先阅读脚本。

curl -fsSL https://pirateface.co/package.sh | bash -s -- --repo sergeyzh/rubert-tiny-retriever ./model-folder
需要做种者 →

Быстрая модель BERT для задач текстового поиска (retrieval). Модель получена дистилляцией эмбеддингов русских и английских текстов BAAI/bge-m3 в rubert-tiny-turbo.

Основные характеристики модели:

  • размер ембеддинга - 312,
  • длина контекста - 512,
  • слоёв - 3,
  • префиксы - не требуются.

Использование

from sentence_transformers import SentenceTransformer

model = SentenceTransformer('sergeyzh/rubert-tiny-retriever')

sentences = ["привет мир", "hello world", "здравствуй вселенная"]
embeddings = model.encode(sentences)
print(model.similarity(embeddings, embeddings))

Метрики

Оценки модели на задачах текстового поиска для русского языка:

Model Name MIRACL Reranking MIRACL Retrival RiaNews Retrieval RuBQ Reranking RuBQ Retrieval Average
bge-m3 0,654 0,702 0,830 0,740 0,712 0,728
rubert-tiny-retriever 0,574 0,530 0,611 0,668 0,589 0,594
rubert-tiny-turbo 0,477 0,371 0,513 0,622 0,517 0,500
rubert-tiny2 0,158 0,019 0,140 0,461 0,109 0,177

Оценки модели на задачах текстового поиска для английского языка:

Model Name AILA Statutes Argu Ana Legal Bench Corporate Lobbying SCIDOCS Stack Overflow QA Statcan Dialogue Dataset Retrieval Wikipedia Retrieval Multilingual Average
bge-m3 0,298 0,539 0,904 0,164 0,806 0,284 0,924 0,560
rubert-tiny-retriever 0,161 0,432 0,862 0,094 0,454 0,103 0,880 0,426
rubert-tiny-turbo 0,136 0,320 0,700 0,041 0,320 0,007 0,298 0,260
rubert-tiny2 0,138 0,277 0,602 0,012 0,200 0,004 0,145 0,197