
Hosted by Kana & Mari · JA

Resembleの音声生成APIとUnityを連携させるためのUnityプラグインです。生成音声や音素・タイミング情報をUnity内で扱い、音素テーブルを利用したシェーダー制御やBlendShapeによるキャラクターのリップシンクを実現します。サンプルシーンや音声アセットも含まれています。

Guided Attentionを用いた深層畳み込みネットワークベースのText-to-Speech(TTS)システムをPyTorchで実装しています。テキストからメルスペクトログラムを生成するText2Melモデルと、メルスペクトログラムから線形スペクトログラムを高解像度化するSSRNモデルの学習・音声合成・データ前処理に対応し、英語(LJ Speech)とモンゴル語(Mongolian Bible)のデータセットを利用できます。

NobodyWhoは、llama.cppを基盤としてGGUF形式の大規模言語モデルを端末上でオフライン推論するRust製の推論エンジンです。ストリーミングチャット、会話コンテキスト管理、文法ベースのツール呼び出し、埋め込み・再ランキング、画像・音声入力、音声合成およびモデルダウンロードを提供し、Kotlin、Swift、Python、Flutter、React Native、Godotから利用できます。

ComfyUI上でVoxCPM2を利用した多言語Text-to-Speech機能を提供するカスタムノードです。音声デザイン、参照音声による可 controllable/ultimate voice cloning、48kHz音声出力、LoRAの読み込みとComfyUI内でのLoRA学習に対応しています。ASRによる参照音声の自動文字起こし、ノイズ除去、モデルの自動管理、torch.compile最適化なども提供します。

音声基盤モデルの評価を統合的に行うためのオープンソース・フレームワークです。音声理解(ASR/AST/感情認識など)、音声生成(Speech-to-Speech/TTS)、音声コーデック評価を含む複数ベンチマークをまとめ、データセット管理、評価指標の実行、再現実験、断点再開や並列実行まで支援します。

EVAは、会話型音声エージェントをエンドツーエンドで評価するためのオープンソースフレームワークです。音声入力から会話の完了度(Accuracy)と対話体験(Experience)を自動採点し、ボット同士の音声対話、ツール実行、検証、メトリクス集計までを一連で行います。航空・医療HR・ITSMなどの企業向けシナリオデータセットや、ノイズ・アクセント・回線劣化などの摂動評価も含まれます。

ZAI/GLMのTTS(音声合成)APIを提供するプロキシ/ラッパー系のリポジトリです。Docker、CLI、Home Assistant連携を通じて、智谱TTSの内蔵音色やクローン音色を使った音声合成をローカル環境から利用できるようにしています。

TelnyxのAI向け開発支援リポジトリで、AIエージェントやAI-first開発者がTelnyx APIを使いやすくするためのツール群をまとめています。主な内容は、Python/TypeScriptのAgent Toolkit、エージェント向けCLI、Claude Code/Cursor/Gemini/OpenCode向けプラグイン、MCPプロキシ、Agent Skills、運用ガイドです。

Meta-StyleSpeech / StyleSpeech の PyTorch 実装で、マルチスピーカー対応のテキスト音声合成(TTS)を学習・推論するためのリポジトリです。LibriTTS などのデータセットを前処理し、メタ学習を含む学習、単文・バッチ推論、TensorBoard での可視化を行えます。

LocalText2Voice は、長文テキストを AI 音声で読み上げて MP3 のオーディオブックやポッドキャスト風音声を作成するデスクトップアプリです。Piper などのローカル TTS エンジンを中心に、必要に応じて OpenAI / ElevenLabs / Gemini / Azure などのクラウド API も使え、音声生成後のレビュー、字幕、BGM 付きミックスまで一連の制作フローを扱います。