hfvladkon/bert_token_classification_detector
RuModernBERT, родная токенизация, двухэтапное обучение (лучшая модель)
Ветка main репозитория hfvladkon/bert_token_classification_detector.
Разметчик дефектов в ответах Qwen3.8-Flash-Next. Модель помечает токены ответа Qwen, в которых есть языковой дефект: иероглифы среди русского текста, латинские и прочие иностранные вставки, смешение алфавитов внутри слова, транслитерация, ошибки согласования, управления, морфологии, орфографии и пропуски слов.
- Вход: текст ответа (декодированные без потерь токены Qwen) в родной токенизации энкодера; вероятности усредняются обратно на токены Qwen.
- Выход: метка на каждый токен ответа Qwen:
O,BAD-script,TAIL-script,BAD-grammar,TAIL-grammar. BAD — первый дефектный токен ошибки, TAIL — продолжение той же ошибки. - Пороги (
config.defect_threshold, [алфавит, грамматика]): [0.5, 0.9]. Токен считается дефектным, если сумма вероятностей BAD+TAIL его группы не меньше порога. Пороги подобраны по предсказаниям вне фолдов кросс-валидации (или на val, где CV нет); порог, подобранный на val основного сплита, лежит вconfig.defect_threshold_val.
Как запустить
import sys
from huggingface_hub import snapshot_download
path = snapshot_download("hfvladkon/bert_token_classification_detector", revision="main")
sys.path.insert(0, f"{path}/code")
from tag import Tagger
t = Tagger(path)
# ответ текстом (токенизируется токенизатором Qwen3.8), либо готовые id Qwen: t.tag_ids(ids, answer_start, query)
ids, answer_start, probs, spans = t.tag_text("текст ответа", query="вопрос пользователя")
print(spans) # [{'tokens': [s, e], 'text': ..., 'p': ..., 'group': 'script'|'grammar'}]Из командной строки: python code/tag.py --model <path> --query "..." --answer-file answer.txt. Нужны torch и transformers 5.x.
Обучение
Данные: 1000 ответов Qwen3.8-Flash-Next, размеченных вручную агентом по токенам (1129 ошибок; схема O / BAD / TAIL, зависимые, спорные и неуверенные места в обучении не участвуют), плюс исправленные версии тех же ответов как негативы и синтетические ошибки (pymorphy3: согласование, управление, морфология, орфография, пропуски; вставки иероглифов, латиницы и смешение алфавитов) на русской Википедии. Сплит 800 / 100 / 100 ответов.
Этап 1: только синтетика на русской Википедии и Викитеке (8000 документов, около 15 тыс. ошибок). Этап 2: реальная разметка плюс грамматическая синтетика с весом 0.3, 6 эпох, lr 3e-5, лучшая эпоха по F1 на пересечении спанов.
Качество
Метрика — совпадение спанов по пересечению: эталонная ошибка найдена, если её пересекает предсказанный спан той же группы; предсказанный спан верен, если пересекает эталонный. Спаны извлекаются из BIO так же, как в seqeval.
Test содержит 114 ошибок, разброс между сидами там до ±0.07 F1, поэтому модели сравниваются по кросс-валидации. Если грамматику нужно ловить чаще: порог грамматики 0.5 даёт по CV F1 грамматики 0.311 (P 0.38, R 0.26) при общем F1 0.658.
Все ветки
Ограничения: разметка агентская и неполная, часть «ложных» срабатываний — настоящие непомеченные ошибки. Грамматику все модели находят заметно хуже, чем алфавитные дефекты (иероглифы находятся почти всегда, английские вставки — примерно в 95% случаев).
