Aleksei Dorkin PRO
adorkin
AI & ML interests
Computational Linguistics
Recent Activity
updated a collection about 9 hours ago
🇪🇪 Estonian LLM Evaluation updated a dataset about 9 hours ago
tartuNLP/Estonian_Subjectivity commentedon a paper about 9 hours ago
Creation of the Estonian Subjectivity Dataset: Assessing the Degree of Subjectivity on a ScaleOrganizations
Math Datasets
Code SFT Datasets
-
nvidia/Nemotron-Cascade-SFT-Stage-1
Viewer • Updated • 3.62M • 1.69k • 24 -
nvidia/Nemotron-Cascade-SFT-Stage-2
Viewer • Updated • 5.31M • 1.4k • 18 -
nvidia/Nemotron-Cascade-SFT-SWE
Viewer • Updated • 141k • 361 • 17 -
inclusionAI/Ling-Coder-SFT
Viewer • Updated • 4.48M • 1.06k • 45
Reward Models
-
nvidia/Llama-3.3-Nemotron-70B-Reward-Multilingual
Text Generation • 71B • Updated • 294 • • 10 -
nvidia/Llama-3.3-Nemotron-70B-Reward-Principle
Text Generation • 71B • Updated • 223 • • 7 -
nvidia/Qwen-3-Nemotron-32B-Reward
Text Classification • 32B • Updated • 271 • 20 -
Skywork/Skywork-Reward-V2-Llama-3.1-8B
Text Classification • 8B • Updated • 10.6k • 48
My Shared Task Papers
-
TartuNLP @ SIGTYP 2024 Shared Task: Adapting XLM-RoBERTa for Ancient and Historical Languages
Paper • 2404.12845 • Published -
TartuNLP at EvaLatin 2024: Emotion Polarity Detection
Paper • 2405.01159 • Published -
TartuNLP @ AXOLOTL-24: Leveraging Classifier Output for New Sense Detection in Lexical Semantics
Paper • 2407.03861 • Published -
TartuNLP at SemEval-2025 Task 5: Subject Tagging as Two-Stage Information Retrieval
Paper • 2504.21547 • Published
Multilingual Text Embedding Models
-
tencent/KaLM-Embedding-Gemma3-12B-2511
Sentence Similarity • 12B • Updated • 10.9k • 101 -
nvidia/llama-embed-nemotron-8b
Feature Extraction • 8B • Updated • 456k • 170 -
Qwen/Qwen3-Embedding-8B
Feature Extraction • 8B • Updated • 2.88M • • 776 -
Qwen/Qwen3-Embedding-4B
Feature Extraction • 4B • Updated • 3.94M • 308
Code RL Datasets
Multi-Turn Chat
Llama 3(.1) 8B Finetunes
-
nvidia/Llama-3.1-Nemotron-Nano-8B-v1
Text Generation • 8B • Updated • 174k • • 224 -
nvidia/llama-3.1-nemoguard-8b-topic-control
Text Classification • Updated • 1.03k • 20 -
nvidia/llama-3.1-nemoguard-8b-content-safety
Text Classification • Updated • 584 • 37 -
nvidia/Llama-3.1-Nemotron-Nano-VL-8B-V1
Image-Text-to-Text • 9B • Updated • 947k • 181
Multilingual Text Encoders
Multilingual Text Embedding Models
-
tencent/KaLM-Embedding-Gemma3-12B-2511
Sentence Similarity • 12B • Updated • 10.9k • 101 -
nvidia/llama-embed-nemotron-8b
Feature Extraction • 8B • Updated • 456k • 170 -
Qwen/Qwen3-Embedding-8B
Feature Extraction • 8B • Updated • 2.88M • • 776 -
Qwen/Qwen3-Embedding-4B
Feature Extraction • 4B • Updated • 3.94M • 308
Math Datasets
Code RL Datasets
Code SFT Datasets
-
nvidia/Nemotron-Cascade-SFT-Stage-1
Viewer • Updated • 3.62M • 1.69k • 24 -
nvidia/Nemotron-Cascade-SFT-Stage-2
Viewer • Updated • 5.31M • 1.4k • 18 -
nvidia/Nemotron-Cascade-SFT-SWE
Viewer • Updated • 141k • 361 • 17 -
inclusionAI/Ling-Coder-SFT
Viewer • Updated • 4.48M • 1.06k • 45
Multi-Turn Chat
Reward Models
-
nvidia/Llama-3.3-Nemotron-70B-Reward-Multilingual
Text Generation • 71B • Updated • 294 • • 10 -
nvidia/Llama-3.3-Nemotron-70B-Reward-Principle
Text Generation • 71B • Updated • 223 • • 7 -
nvidia/Qwen-3-Nemotron-32B-Reward
Text Classification • 32B • Updated • 271 • 20 -
Skywork/Skywork-Reward-V2-Llama-3.1-8B
Text Classification • 8B • Updated • 10.6k • 48
Llama 3(.1) 8B Finetunes
-
nvidia/Llama-3.1-Nemotron-Nano-8B-v1
Text Generation • 8B • Updated • 174k • • 224 -
nvidia/llama-3.1-nemoguard-8b-topic-control
Text Classification • Updated • 1.03k • 20 -
nvidia/llama-3.1-nemoguard-8b-content-safety
Text Classification • Updated • 584 • 37 -
nvidia/Llama-3.1-Nemotron-Nano-VL-8B-V1
Image-Text-to-Text • 9B • Updated • 947k • 181
My Shared Task Papers
-
TartuNLP @ SIGTYP 2024 Shared Task: Adapting XLM-RoBERTa for Ancient and Historical Languages
Paper • 2404.12845 • Published -
TartuNLP at EvaLatin 2024: Emotion Polarity Detection
Paper • 2405.01159 • Published -
TartuNLP @ AXOLOTL-24: Leveraging Classifier Output for New Sense Detection in Lexical Semantics
Paper • 2407.03861 • Published -
TartuNLP at SemEval-2025 Task 5: Subject Tagging as Two-Stage Information Retrieval
Paper • 2504.21547 • Published