Skip to content

Repository files navigation

meeting-analyzer

会議録画をコマンド一発で議事録+提言に変換するツール。

動作要件

Apple Silicon Mac(M1以降)が必須です。 MLX WhisperはAppleのMLXフレームワーク上で動作するため、Intel Macでは動きません。

何ができるか

./meeting-analyzer.sh ~/Downloads/meeting.mp4 "定例会議"

会議録画から以下を自動生成します(処理時間は環境に依存します)。

  • 議事録レポート — 概要・決定事項・アクションアイテム・提言
  • 文字起こし — 全文テキスト
  • スクリーンキャプチャ — シーン変化検出で自動抽出

バージョン — 段階的に精度とコストが上がる

バージョン ファイル AI分析 対象 追加コスト
v1 meeting-analyzer.sh GitHub Copilot CLI GitHub Copilotが使える環境 1 Premium Request
v2 v1の出力 + Gemini Gem Gemini Gem(手動) Geminiが使える環境 なし
v3 meeting-analyzer-v3.sh Claude API + VLM Anthropic APIキーが必要 従量課金

まずv1を試してください。 精度を上げたい場合はv2(Gemini Gem)、さらに自動化したい場合はv3(外部API)に進んでください。

必要なツール

全バージョン共通

  • ffmpeg — 音声抽出・シーン検出キャプチャ(brew install ffmpeg
  • MLX Whisper — Apple Silicon最適化の文字起こし(pip3 install mlx-whisper

v1で追加

  • GitHub CLIgh コマンド(brew install gh
  • GitHub Copilot CLIgh copilot で議事録生成

v2で追加

  • Geminigem-meeting-analyzer-prompt.md を使って自分用のGemを作成

v3で追加

  • Anthropic Python SDKpip3 install anthropic
  • ANTHROPIC_API_KEY.env に設定

インストール

# リポジトリをクローン
git clone https://github.com/ap-communications/meeting-analyzer.git
cd meeting-analyzer

# 依存ツールのインストール
brew install ffmpeg gh
pip3 install -r requirements.txt

# v3を使う場合のみ: APIキーの設定
echo "ANTHROPIC_API_KEY=sk-ant-..." > .env

使い方

v1: GitHub Copilot

./meeting-analyzer.sh ~/Downloads/meeting.mp4 "定例会議"

GitHub Copilot CLIが文字起こしテキストを分析し、議事録を生成します。1 Premium Requestで完結。

出力:

meeting_YYYYMMDD_HHMMSS/
├── report.md           — AI分析レポート
├── transcript.txt      — 文字起こし
├── prompt.md           — AI分析用プロンプト
├── captures/           — スクリーンキャプチャ
└── log.md              — 処理ログ

v2: Gemini Gem で精度を上げる

v1を実行した後、出力された prompt.md を Gemini Gem に貼り付けるだけです。

Gemの作り方

  1. Gemini → 左サイドバー「Gem」→「+ Gemを作成」
  2. 名前: 会議分析アシスタント
  3. カスタム指示: gem-meeting-analyzer-prompt.md--- 以下をコピーして貼り付け
  4. 保存

使い方

  1. v1を実行して prompt.mdcaptures/ を取得
  2. 作成したGemに prompt.md の内容を貼り付ける
  3. 同じチャットに captures/ の画像を投入(10枚単位)
  4. 文脈を持った状態で、文字起こし + 画像の統合分析が返ってくる

v1より精度が高くなる理由は、人間が会議の文脈を補足しながらGeminiと対話できるからです。

v3: 外部API で完全自動化(Anthropic APIキーが必要)

v2のGemini Gem運用では、1回のチャットで投入できる画像が10枚までという制約があり、キャプチャが多い長時間の会議では手間が増えます。v3はClaude APIを使い、この制約なしに文字起こしからタイムライン統合・議事録生成までを完全自動化します。

VLM(Vision Language Model)を使ったキャプチャ画像の自動分析にも対応する設計ですが、現時点ではVLMモードは実験的です。安定動作が確認されているのは VLM_MODE=skip(テキスト分析のみ)です。

# テキスト分析のみ(安定動作確認済み)
VLM_MODE=skip ./meeting-analyzer-v3.sh ~/Downloads/meeting.mp4 "定例会議"

# テキスト + 画像分析(実験的。Claude APIでキャプチャ画像を分析)
# → スライドの固有名詞・図表をAIが読み取り、議事録に統合することを目指す
VLM_MODE=claude ./meeting-analyzer-v3.sh ~/Downloads/meeting.mp4 "定例会議"

出力:

meeting_YYYYMMDD_HHMMSS/
├── report.md               — AI分析レポート
├── timeline.md             — 統合タイムライン(発言+画面)
├── transcript.srt          — タイムスタンプ付き文字起こし
├── transcript.txt          — プレーンテキスト
├── vlm_results.jsonl       — VLM画像分析結果
├── capture_timestamps.txt  — キャプチャ時刻
├── captures/               — スクリーンキャプチャ
└── log.md                  — 処理ログ

環境変数(v3用)

変数 デフォルト 説明
VLM_MODE claude VLM分析モード(claude / ollama / hybrid / skip)
SCENE_THRESHOLD 0.25 シーン検出感度(0.0〜1.0、低いほど敏感)
MAX_IMAGES 30 最大キャプチャ枚数
MLX_WHISPER mlx_whisper MLX Whisperのパス
ANTHROPIC_API_KEY Claude APIキー
CLAUDE_MODEL claude-sonnet-4-6 使用するClaudeモデル

実測結果(参考値)

項目 結果
テスト動画 1時間3分の会議録画
マシン MacBook Pro(Apple M5 / 32GB)
文字起こし 約3分(993行)
キャプチャ 12枚(threshold=0.25)
AI分析(v1) 1 Premium Request、約1分30秒
AI分析(v3) 約2万トークン(Claude API)

重要な気づき

完全自動化すると、参加者の文脈理解・会議の背景・発言者の意図が剥がれ、抽象的な要約しか残りません。

最も精度が高い分析は、AIに文字起こしを渡す際に人間が会議の文脈を補足したもの(v2のGemini Gem運用)でした。

機械的な作業はAIに任せ、文脈の補足と最終判断は人間が担う。この分担が最も精度の高い議事録を生み出します。

ライセンス

MIT

About

会議録画をコマンド一発で議事録+提言に変換するツール。MLX Whisper + ffmpeg + AI(GitHub Copilot / Claude API)

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Used by

Contributors

Languages