文字誤り率の相対削減
約83%ベースモデルとの比較
医療CER 30.97% → 5.23%
Medical Speech Recognition
医療の声を、正確な記録に。
医師が開発・評価に参加。
医療の言葉を理解する、日本語音声認識へ。
The Challenge
疾患名、治療法、検査名、略語。医療現場には、汎用の音声認識AIが苦手とする言葉が数多くあります。音の似た日常語への置き換えや、長い発話の脱落が、正確な記録の妨げになります。
Mediestは、独自の医療音声と一般日本語音声を用いてモデルを追加学習。医師の専門知識とAI技術を組み合わせ、医療従事者の文字起こし・記録作成を支援する音声認識AIを開発しました。
Results
医療専門音声の社内評価で、文字誤り率(CER。低いほど高精度)を改善。CPU向けモデルの軽量化と処理速度も検証しました。
文字誤り率の相対削減
約83%ベースモデルとの比較
医療CER 30.97% → 5.23%
医療専門音声の文字誤り率
5.23%GPU高精度モデル
医療評価データ10件
CPU向けモデル容量
2.7GB約7.9GBから約66%小型化
動的INT8モデル
CPUでの処理時間
約13秒1分の音声に対する換算値
Greedy推論・RTF 0.210
いずれも社内評価。CPU評価環境:AMD Ryzen 9 7950X(16コア/32スレッド)。認識精度・速度は音声や実行環境によって異なります。評価結果の詳細を見る
棒の長さはCERに比例しています。ベースモデル:CohereLabs/cohere-transcribe-03-2026。
Recognition Examples
社内評価で確認した認識例です。医療分野への追加学習によって、文脈に合わない置き換えや情報の脱落を改善しました。
ベースモデル
「神話性が高いことが知られます。」
「親和性」を、音の似た「神話性」と認識。
医療特化モデル
「親和性が高いことが知られます。」
医療用語の「親和性」を正しく認識。
認識結果の一部を抜粋。
心臓再同期療法、心室細動、多発性嚢胞腎、腎機能などを含む長文では、ベースモデルが前半部分を大きく脱落させるケースがありました。医療特化モデルでは長文全体を認識し、重要な情報の脱落を改善しました。
Technology & Team
医師とAI開発者が一体となり、データの確認から追加学習、評価、推論の最適化まで取り組んでいます。
01
疾患名や治療法が正しく認識されているか、重要な情報が脱落していないか。医師が認識結果を一文ずつ確認し、医療現場の視点をモデル改善へ反映しています。
02
医療音声と一般日本語音声を組み合わせ、LoRAによる追加学習を実施。学習率やデータ混合比などを12段階で検証し、専門用語への強さと一般日本語の認識性能のバランスを追求しました。
03
ONNX変換とINT8動的量子化により、約7.9GBのモデルを約2.7GBへ小型化。用途に応じて推論方式を選び、院内・社内で音声を処理する構成にも対応できます。
医療データへの適応を強めると、一般日本語の認識性能が低下する課題がありました。一般日本語音声の混合比や学習条件を調整し、さらに量子化時の文末反復を抑えるため、動的量子化とBeam Searchも検証。専門用語への強さと運用時の品質・速度を両面から評価しています。
Use Cases
医療音声の文字起こしと、記録作成支援を想定しています。
医師が話した内容をテキスト化し、カルテや診療記録の下書き作成を支援します。
疾患名や治療法が多く登場する会議を文字起こしし、議事録作成や情報共有に活用できます。
医療講演や教育コンテンツをテキスト化し、検索可能なナレッジとして蓄積できます。
大量の医療音声を文字起こしし、研究データの整理や分析を支援します。
CPU向けモデルにより、クラウドへ音声を送信せずに処理する構成にも対応できます。診療科や利用場面に合わせた追加学習、既存システムとの連携を検討できます。
Benchmarks
以下は社内評価の結果です。CERは文字誤り率を表し、低いほど高精度です。
画面幅に収まらない表は、横にスクロールしてご覧いただけます。
| 評価対象 | ベースモデル | 医療特化モデル | 比較結果 |
|---|---|---|---|
| 医療専門音声 | 30.97% | 5.23% | 約83%相対削減 |
| 核医学講演 | 22.73% | 19.97% | 約12%相対削減 |
| 医療制度・講演音声 | 15.66% | 14.04% | 約10%相対削減 |
| Common Voice日本語 | 24.96% | 22.84% | 約8%相対削減 |
| 一般放送音声 | 12.25% | 12.64% | ほぼ同等の性能を維持 |
| モデル | 実行環境 | 医療CER | RTF | 容量 |
|---|---|---|---|---|
| 高精度モデル | GPU | 5.23% | 0.022 | 約7.9GB |
| 動的INT8(Greedy) | CPU | 6.02% | 0.210 | 約2.7GB |
| 動的INT8+Beam Search | CPU | 6.41% | 0.563 | 約2.7GB |
医療専門音声の評価データは10件。独自医療データは学習用4,464件、検証用496件を使用しています。ベースモデルはCohereLabs/cohere-transcribe-03-2026です。
CPU評価環境はAMD Ryzen 9 7950X(16コア/32スレッド)。RTFは音声の長さに対する処理時間の比率で、1未満なら音声の実時間より高速です。1分の音声に換算すると、Greedy推論は約13秒、Beam Searchは約34秒に相当します。
Greedy推論は処理速度を重視する場合、Beam Searchは文章全体の安定性を重視する場合の選択肢です。今回の医療CERはGreedy推論の方が低い結果となっています。性能値は評価データと実行条件に依存します。
Collaboration
医療機関、研究機関、ヘルスケア企業との共同研究・実証実験に取り組みます。個別領域への追加学習、オンプレミス構成、既存システムとの連携など、利用場面に合わせた活用を支援します。
Mediestの会社情報を見る本モデルは、Cohere Labsが公開するcohere-transcribe-03-2026をベースに、当社独自の医療音声データおよび日本語音声データを用いて追加学習・最適化したものです。学習には放射線医学を中心とする学会教育講演も使用しています。一般日本語性能の学習・評価には、ReazonSpeechおよびMozilla Common Voiceを使用しています。
研究開発一覧へ戻る