会議録画をコマンド一発で議事録+提言に変換するツール。
Apple Silicon Mac(M1以降)が必須です。 MLX WhisperはAppleのMLXフレームワーク上で動作するため、Intel Macでは動きません。
./meeting-analyzer.sh ~/Downloads/meeting.mp4 "定例会議"会議録画から以下を自動生成します(処理時間は環境に依存します)。
- 議事録レポート — 概要・決定事項・アクションアイテム・提言
- 文字起こし — 全文テキスト
- スクリーンキャプチャ — シーン変化検出で自動抽出
| バージョン | ファイル | AI分析 | 対象 | 追加コスト |
|---|---|---|---|---|
| v1 | meeting-analyzer.sh |
GitHub Copilot CLI | GitHub Copilotが使える環境 | 1 Premium Request |
| v2 | v1の出力 + Gemini Gem | Gemini Gem(手動) | Geminiが使える環境 | なし |
| v3 | meeting-analyzer-v3.sh |
Claude API + VLM | Anthropic APIキーが必要 | 従量課金 |
まずv1を試してください。 精度を上げたい場合はv2(Gemini Gem)、さらに自動化したい場合はv3(外部API)に進んでください。
- ffmpeg — 音声抽出・シーン検出キャプチャ(
brew install ffmpeg) - MLX Whisper — Apple Silicon最適化の文字起こし(
pip3 install mlx-whisper)
- GitHub CLI —
ghコマンド(brew install gh) - GitHub Copilot CLI —
gh copilotで議事録生成
- Gemini —
gem-meeting-analyzer-prompt.mdを使って自分用のGemを作成
- Anthropic Python SDK —
pip3 install anthropic - ANTHROPIC_API_KEY —
.envに設定
# リポジトリをクローン
git clone https://github.com/ap-communications/meeting-analyzer.git
cd meeting-analyzer
# 依存ツールのインストール
brew install ffmpeg gh
pip3 install -r requirements.txt
# v3を使う場合のみ: APIキーの設定
echo "ANTHROPIC_API_KEY=sk-ant-..." > .env./meeting-analyzer.sh ~/Downloads/meeting.mp4 "定例会議"GitHub Copilot CLIが文字起こしテキストを分析し、議事録を生成します。1 Premium Requestで完結。
出力:
meeting_YYYYMMDD_HHMMSS/
├── report.md — AI分析レポート
├── transcript.txt — 文字起こし
├── prompt.md — AI分析用プロンプト
├── captures/ — スクリーンキャプチャ
└── log.md — 処理ログ
v1を実行した後、出力された prompt.md を Gemini Gem に貼り付けるだけです。
- Gemini → 左サイドバー「Gem」→「+ Gemを作成」
- 名前:
会議分析アシスタント - カスタム指示:
gem-meeting-analyzer-prompt.mdの---以下をコピーして貼り付け - 保存
- v1を実行して
prompt.mdとcaptures/を取得 - 作成したGemに
prompt.mdの内容を貼り付ける - 同じチャットに
captures/の画像を投入(10枚単位) - 文脈を持った状態で、文字起こし + 画像の統合分析が返ってくる
v1より精度が高くなる理由は、人間が会議の文脈を補足しながらGeminiと対話できるからです。
v2のGemini Gem運用では、1回のチャットで投入できる画像が10枚までという制約があり、キャプチャが多い長時間の会議では手間が増えます。v3はClaude APIを使い、この制約なしに文字起こしからタイムライン統合・議事録生成までを完全自動化します。
VLM(Vision Language Model)を使ったキャプチャ画像の自動分析にも対応する設計ですが、現時点ではVLMモードは実験的です。安定動作が確認されているのは VLM_MODE=skip(テキスト分析のみ)です。
# テキスト分析のみ(安定動作確認済み)
VLM_MODE=skip ./meeting-analyzer-v3.sh ~/Downloads/meeting.mp4 "定例会議"
# テキスト + 画像分析(実験的。Claude APIでキャプチャ画像を分析)
# → スライドの固有名詞・図表をAIが読み取り、議事録に統合することを目指す
VLM_MODE=claude ./meeting-analyzer-v3.sh ~/Downloads/meeting.mp4 "定例会議"出力:
meeting_YYYYMMDD_HHMMSS/
├── report.md — AI分析レポート
├── timeline.md — 統合タイムライン(発言+画面)
├── transcript.srt — タイムスタンプ付き文字起こし
├── transcript.txt — プレーンテキスト
├── vlm_results.jsonl — VLM画像分析結果
├── capture_timestamps.txt — キャプチャ時刻
├── captures/ — スクリーンキャプチャ
└── log.md — 処理ログ
| 変数 | デフォルト | 説明 |
|---|---|---|
VLM_MODE |
claude |
VLM分析モード(claude / ollama / hybrid / skip) |
SCENE_THRESHOLD |
0.25 |
シーン検出感度(0.0〜1.0、低いほど敏感) |
MAX_IMAGES |
30 |
最大キャプチャ枚数 |
MLX_WHISPER |
mlx_whisper |
MLX Whisperのパス |
ANTHROPIC_API_KEY |
— | Claude APIキー |
CLAUDE_MODEL |
claude-sonnet-4-6 |
使用するClaudeモデル |
| 項目 | 結果 |
|---|---|
| テスト動画 | 1時間3分の会議録画 |
| マシン | MacBook Pro(Apple M5 / 32GB) |
| 文字起こし | 約3分(993行) |
| キャプチャ | 12枚(threshold=0.25) |
| AI分析(v1) | 1 Premium Request、約1分30秒 |
| AI分析(v3) | 約2万トークン(Claude API) |
完全自動化すると、参加者の文脈理解・会議の背景・発言者の意図が剥がれ、抽象的な要約しか残りません。
最も精度が高い分析は、AIに文字起こしを渡す際に人間が会議の文脈を補足したもの(v2のGemini Gem運用)でした。
機械的な作業はAIに任せ、文脈の補足と最終判断は人間が担う。この分担が最も精度の高い議事録を生み出します。
MIT