Hugging Face が音声モデル「Nemotron 3.5 ASR」の言語別ファインチューニング・ガイドを公開した。発生元は HF 公式1件に arXiv 4件が続く強い学術構成で、発表よりも研究の蓄積を実装手順として束ねた動き――誰でも辿れる手引きの形をとる。汎用の音声認識モデルを、言語ごとの特性に合わせて微調整し精度を上げるという主眼で、本流は「大きな一つのモデル」から「各言語へ軽く適応させる」運用へ移りつつある点にある。多言語 ASR を実務者が自前で最適化できる形に整理された点が要点だ。ただし公開直後で、実際の言語別精度改善の度合いや、非英語圏での採用の広がりは今後の確認点だ。
HF、Nemotron 3.5 ASRの言語別微調整ガイド
HF、Nemotron 3.5 ASRの言語別微調整ガイド
How to Fine-Tune Nemotron 3.5 ASR for Your Language, Domain, or Accent
NVIDIA、音声認識 Nemotron 3.5 ASR の言語・ドメイン別ファインチューニング手法を公開
学術(arxiv ほか) 6本 ▾
USAD 2.0: Scaling Representation Distillation for Universal Audio Understanding
USAD 2.0、汎用音声理解へ表現蒸留をスケールする音声エンコーダ
From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation
LLMのヘイト判定で人口統計的視点取得を評価、ペルソナ条件付けを検証
FiLM-Based Speaker Conditioning of a SpeechLLM for Pathological Speech Recognition
FiLMで話者条件付けしたSpeechLLMで病的音声認識を改善
Revisiting Lexicon Evaluation in Unsupervised Word Discovery
教師なし単語発見の語彙評価を再検討、編集距離指標の信頼性を問う
Ouvia、実利用での音声翻訳の使いやすさを測る利用者中心の枠組み
ProSarc: Prosody-Aware Sarcasm Recognition Framework via Temporal Prosodic Incongruity
ProSarc、時間的韻律の不一致で皮肉を検出する音声専用フレームワーク