Medical Speech Recognition

医療音声認識AI

医療の声を、正確な記録に。

医師が開発・評価に参加。
医療の言葉を理解する、日本語音声認識へ。

The Challenge

医療の言葉を、
文脈に沿って捉える。

疾患名、治療法、検査名、略語。医療現場には、汎用の音声認識AIが苦手とする言葉が数多くあります。音の似た日常語への置き換えや、長い発話の脱落が、正確な記録の妨げになります。

Mediestは、独自の医療音声と一般日本語音声を用いてモデルを追加学習。医師の専門知識とAI技術を組み合わせ、医療従事者の文字起こし・記録作成を支援する音声認識AIを開発しました。

Results

数字で見る開発成果

医療専門音声の社内評価で、文字誤り率(CER。低いほど高精度)を改善。CPU向けモデルの軽量化と処理速度も検証しました。

文字誤り率の相対削減

約83%

ベースモデルとの比較
医療CER 30.97% → 5.23%

医療専門音声の文字誤り率

5.23%

GPU高精度モデル
医療評価データ10件

CPU向けモデル容量

2.7GB

約7.9GBから約66%小型化
動的INT8モデル

CPUでの処理時間

約13秒

1分の音声に対する換算値
Greedy推論・RTF 0.210

いずれも社内評価。CPU評価環境:AMD Ryzen 9 7950X(16コア/32スレッド)。認識精度・速度は音声や実行環境によって異なります。評価結果の詳細を見る

医療専門音声の文字誤り率(社内評価)
ベースモデル
30.97%
医療特化モデル
5.23%

棒の長さはCERに比例しています。ベースモデル:CohereLabs/cohere-transcribe-03-2026。

Recognition Examples

専門用語も、長い発話も。

社内評価で確認した認識例です。医療分野への追加学習によって、文脈に合わない置き換えや情報の脱落を改善しました。

ベースモデル

医療用語を日常語に置き換え

「神話性が高いことが知られます。」

「親和性」を、音の似た「神話性」と認識。

医療特化モデル

医療文脈に沿った文字起こし

「親和性が高いことが知られます。」

医療用語の「親和性」を正しく認識。

認識結果の一部を抜粋。

長い発話に含まれる情報の脱落も改善

心臓再同期療法、心室細動、多発性嚢胞腎、腎機能などを含む長文では、ベースモデルが前半部分を大きく脱落させるケースがありました。医療特化モデルでは長文全体を認識し、重要な情報の脱落を改善しました。

Technology & Team

医師の専門性を、モデルの力に。

医師とAI開発者が一体となり、データの確認から追加学習、評価、推論の最適化まで取り組んでいます。

01

医師による開発・評価

疾患名や治療法が正しく認識されているか、重要な情報が脱落していないか。医師が認識結果を一文ずつ確認し、医療現場の視点をモデル改善へ反映しています。

02

医療特化と一般日本語の両立

医療音声と一般日本語音声を組み合わせ、LoRAによる追加学習を実施。学習率やデータ混合比などを12段階で検証し、専門用語への強さと一般日本語の認識性能のバランスを追求しました。

03

CPUで動作するモデルへ

ONNX変換とINT8動的量子化により、約7.9GBのモデルを約2.7GBへ小型化。用途に応じて推論方式を選び、院内・社内で音声を処理する構成にも対応できます。

精度と実用性を両立するための検証

医療データへの適応を強めると、一般日本語の認識性能が低下する課題がありました。一般日本語音声の混合比や学習条件を調整し、さらに量子化時の文末反復を抑えるため、動的量子化とBeam Searchも検証。専門用語への強さと運用時の品質・速度を両面から評価しています。

Use Cases

医療の声を、活用できる情報へ。

医療音声の文字起こしと、記録作成支援を想定しています。

診療記録の作成支援

医師が話した内容をテキスト化し、カルテや診療記録の下書き作成を支援します。

医療カンファレンスの議事録

疾患名や治療法が多く登場する会議を文字起こしし、議事録作成や情報共有に活用できます。

学会・講演のアーカイブ

医療講演や教育コンテンツをテキスト化し、検索可能なナレッジとして蓄積できます。

研究用音声データの整理

大量の医療音声を文字起こしし、研究データの整理や分析を支援します。

院内・社内で処理するオンプレミス構成にも

CPU向けモデルにより、クラウドへ音声を送信せずに処理する構成にも対応できます。診療科や利用場面に合わせた追加学習、既存システムとの連携を検討できます。

Benchmarks

評価結果と実行環境

以下は社内評価の結果です。CERは文字誤り率を表し、低いほど高精度です。

画面幅に収まらない表は、横にスクロールしてご覧いただけます。

ベースモデルと医療特化モデルの比較
評価対象ベースモデル医療特化モデル比較結果
医療専門音声30.97%5.23%約83%相対削減
核医学講演22.73%19.97%約12%相対削減
医療制度・講演音声15.66%14.04%約10%相対削減
Common Voice日本語24.96%22.84%約8%相対削減
一般放送音声12.25%12.64%ほぼ同等の性能を維持
GPU・CPU向けモデルの性能
モデル実行環境医療CERRTF容量
高精度モデルGPU5.23%0.022約7.9GB
動的INT8(Greedy)CPU6.02%0.210約2.7GB
動的INT8+Beam SearchCPU6.41%0.563約2.7GB

評価条件・数値の読み方

医療専門音声の評価データは10件。独自医療データは学習用4,464件、検証用496件を使用しています。ベースモデルはCohereLabs/cohere-transcribe-03-2026です。

CPU評価環境はAMD Ryzen 9 7950X(16コア/32スレッド)。RTFは音声の長さに対する処理時間の比率で、1未満なら音声の実時間より高速です。1分の音声に換算すると、Greedy推論は約13秒、Beam Searchは約34秒に相当します。

Greedy推論は処理速度を重視する場合、Beam Searchは文章全体の安定性を重視する場合の選択肢です。今回の医療CERはGreedy推論の方が低い結果となっています。性能値は評価データと実行条件に依存します。

Collaboration

専門領域に合わせた
医療音声AIの開発へ。

医療機関、研究機関、ヘルスケア企業との共同研究・実証実験に取り組みます。個別領域への追加学習、オンプレミス構成、既存システムとの連携など、利用場面に合わせた活用を支援します。

Mediestの会社情報を見る

クレジット

本モデルは、Cohere Labsが公開するcohere-transcribe-03-2026をベースに、当社独自の医療音声データおよび日本語音声データを用いて追加学習・最適化したものです。学習には放射線医学を中心とする学会教育講演も使用しています。一般日本語性能の学習・評価には、ReazonSpeechおよびMozilla Common Voiceを使用しています。

研究開発一覧へ戻る