語音、影像與多模態

這個主題底下的 78 個 repo。

78 筆結果

Comfy-Org/ComfyUI

最強的節點式擴散模型工作流介面,把生圖流程拆成可視化的節點圖自由串接。

★ 132.1k · Python · 最後更新 2026-09

Pythonaicomfycomfyui

harry0703/MoneyPrinterTurbo

輸入一個主題或關鍵字,自動用 AI 生成高畫質短影片(腳本、配音、字幕、素材一條龍)。

★ 121.5k · Python · 最後更新 2026-09

Pythonai-video-generatorcontent-creationffmpeg

RVC-Boss/GPT-SoVITS

只要 1 分鐘語音資料就能訓練出好用的 TTS 模型,少樣本語音克隆的代表作。

★ 61.7k · Python · 最後更新 2026-08

Pythontext-to-speechttsvits

remotion-dev/remotion

用 React 寫程式來產生影片,把影片當成可版控、可參數化的元件。

★ 58.6k · TypeScript · 最後更新 2026-09

TypeScriptjavascriptreactvideo

microsoft/VibeVoice

微軟開源的前沿語音 AI 模型,主打長篇、多說話者的自然語音生成。

★ 54k · Python · 最後更新 2026-09

Python

suno-ai/bark

文字驅動的生成式音訊模型,除了說話還能生笑聲、歌聲與環境音。

★ 39.3k · Jupyter Notebook · 最後更新 2024-08

Jupyter Notebook

OpenBMB/VoxCPM

免 tokenizer 的多語言 TTS,支援創意音色設計與高擬真語音克隆。

★ 36.9k · Python · 最後更新 2026-09

Pythonaudiodeeplearningminicpm

Zackriya-Solutions/meetily

隱私優先的 AI 會議助理:本機即時轉錄、分辨說話者、用 Ollama 摘要,完全不上雲。

★ 30.5k · Rust · 最後更新 2026-09

Rustaiai-meeting-assistantllm

hpcaitech/Open-Sora

開源版 Sora,讓一般人也能用得起的高效率影片生成模型與訓練流程。

★ 29.7k · Python · 最後更新 2026-04

Python

ATH-MaaS/Pixelle-Video

全自動短影片生成引擎,串起 ComfyUI 生圖、TTS 配音與影片合成。

★ 27.9k · Python · 最後更新 2026-06

Pythonaigccomfyuiimage-generation

resemble-ai/chatterbox

目前效果最好的開源 TTS 之一,支援情緒誇張度控制。

★ 26.3k · Python · 最後更新 2026-07

Python

SYSTRAN/faster-whisper

用 CTranslate2 重寫的 Whisper,速度快數倍、記憶體省很多,是本機轉錄的首選。

★ 25.3k · Python · 最後更新 2025-11

Pythondeep-learninginferenceopenai

QwenLM/Qwen3-VL

通義千問團隊的 Qwen3-VL 多模態大模型系列,看得懂圖片與影片。

★ 19.9k · Jupyter Notebook · 最後更新 2026-01

Jupyter Notebook

facebookresearch/sam2

Meta 的 Segment Anything 2,影像與影片都能一鍵切割任意物件。

★ 19.8k · Jupyter Notebook · 最後更新 2026-05

Jupyter Notebook

nari-labs/dia

一次生成超擬真對話的 TTS 模型,適合做多角色的口語內容。

★ 19.4k · Python · 最後更新 2025-11

Pythonaiopen-weighttext-to-speech

KlingAIResearch/LivePortrait

讓靜態人像動起來:高效率的表情與頭部動作驅動,可用來做數位人。

★ 19k · Python · 最後更新 2026-06

Pythonface-animationimage-animationvideo-editing

BradyFU/Awesome-Multimodal-Large-Language-Models

多模態大模型的最新進展彙整,論文、榜單、資源持續更新。

★ 18k · — · 最後更新 2026-09

chain-of-thoughtin-context-learninginstruction-following

deepseek-ai/Janus

DeepSeek 的統一多模態模型,理解與生成用同一套架構處理。

★ 17.8k · Python · 最後更新 2025-02

Pythonany-to-anyfoundation-modelsllm

Wan-Video/Wan2.1

阿里的開源大規模影片生成模型,消費級顯示卡也跑得動。

★ 16.9k · Python · 最後更新 2026-03

Pythonaigcvideogeneration

datawhalechina/leedl-tutorial

李宏毅深度學習課程的完整中文筆記(蘋果書),華語圈最受歡迎的深度學習入門教材之一。

★ 16.8k · Jupyter Notebook · 最後更新 2025-11

Jupyter Notebookbertchatgptcnn

SWivid/F5-TTS

用 Flow Matching 做的高擬真 TTS,合成速度與自然度都很突出。

★ 15.2k · Python · 最後更新 2026-07

Python

duixcom/Duix-Avatar

真正開源的數位人工具包,可離線生成影片與克隆數位分身。

★ 15.1k · C · 最後更新 2026-04

Cai-avatarai-avatarscloning

microsoft/TRELLIS

微軟的 3D 生成模型,從文字或圖片產生高品質 3D 資產。

★ 13.6k · Python · 最後更新 2026-06

Python3d3d-aigc3d-generation

Vaibhavs10/insanely-fast-whisper

把 Whisper 榨到極快的推論腳本,幾分鐘轉完數小時音檔。

★ 13.1k · Jupyter Notebook · 最後更新 2025-10

Jupyter Notebook

ace-step/ACE-Step-1.5

本機跑的音樂生成模型,效果勝過多數商用方案,Mac、AMD、Intel、CUDA 都支援。

★ 12.6k · Python · 最後更新 2026-09

Pythontext2music

rany2/edge-tts

不用 Edge、不用 Windows、不用 API key,直接從 Python 呼叫微軟 Edge 的線上 TTS。

★ 11.9k · Python · 最後更新 2026-03

Pythonspeech-synthesistext-to-speechtts

qubvel-org/segmentation_models.pytorch

語意分割模型庫,500+ 預訓練骨幹網路,換一行就換模型。

★ 11.7k · Python · 最後更新 2026-09

Pythoncomputer-visiondeeplab-v3-plusdeeplabv3

QuentinFuxa/WhisperLiveKit

本機即時語音轉文字:串流 ASR、分辨說話者、即時翻譯,API 相容 OpenAI 與 Deepgram。

★ 11k · Python · 最後更新 2026-09

Pythonautomatic-speech-recognitionfastapipython

SparkAudio/Spark-TTS

Spark-TTS 的推論程式碼,基於 LLM 架構的高品質語音合成。

★ 11k · Python · 最後更新 2025-04

Python

KoljaB/RealtimeSTT

低延遲的即時語音轉文字函式庫,內建語音活動偵測與喚醒詞。

★ 10.1k · Python · 最後更新 2026-08

Pythonpythonrealtimespeech-to-text

PeterL1n/RobustVideoMatting

穩健的即時影片去背,支援 PyTorch、TensorFlow.js、ONNX、CoreML 多種部署。

★ 9.5k · Python · 最後更新 2024-04

Pythonaicomputer-visiondeep-learning

deepbeepmeep/Wan2GP

為顯示卡不夠力的人最佳化的影片生成器,支援 Wan、LTX、Hunyuan、Flux 等多種模型。

★ 9.2k · Python · 最後更新 2026-09

Pythonaifluxflux2

studio-dots-ai/dots.ocr

用單一視覺語言模型做多語言文件版面解析,一次搞定 OCR 與結構還原。

★ 9.1k · Python · 最後更新 2026-03

Python

jianchang512/clone-voice

帶網頁介面的聲音克隆工具,用你的音色或任意聲音錄製音檔。

★ 9k · Python · 最後更新 2025-08

Pythonclonevoicespeech-analysisstsarchived

JimmyLv/awesome-nano-banana

Gemini 2.5 Flash Image(Nano Banana)生成圖與提示詞的精選集,想學怎麼下圖片 prompt 看這個。

★ 8.8k · JavaScript · 最後更新 2025-09

JavaScriptchatgptflux-kontextgemini-2-5-flash-image

boson-ai/higgs-audio

Boson AI 的文字—音訊基礎模型,語音生成與理解共用同一套骨幹。

★ 8.3k · Python · 最後更新 2026-06

Python

jamez-bondos/awesome-gpt4o-images

GPT-4o 與 gpt-image-1 生成圖片與提示詞的精選集,看範例學怎麼描述畫面。

★ 8.1k · JavaScript · 最後更新 2025-05

JavaScriptai-artai-image-examplesanime-ai-art

Zyphra/Zonos

用 20 萬小時多語言語音訓練的開放權重 TTS,表現力與品質接近商用等級。

★ 7.2k · Python · 最後更新 2025-03

Python

ngxson/smolvlm-realtime-webcam

用 SmolVLM 加 llama.cpp 做的即時鏡頭視覺理解 demo。

★ 5.6k · HTML · 最後更新 2025-05

HTML

modstart-lib/aigcpanel

一站式的 AI 數位人系統,影片合成、聲音合成、聲音克隆,本機模型一鍵匯入。

★ 5.5k · TypeScript · 最後更新 2026-09

TypeScriptaiaigccosyvoice

OHF-Voice/piper1-gpl

快速的本機神經 TTS 引擎,樹莓派等低階裝置也跑得動。

★ 5.5k · C++ · 最後更新 2026-09

C++

nICEnnnnnnnLee/BilibiliDown

B 站影片下載器(圖形介面),支援稍後再看、收藏夾與 UP 主批次下載。

★ 5.3k · Java · 最後更新 2026-07

Javabilibilicookiedownload-videos

Anil-matcha/AI-Youtube-Shorts-Generator

開源版 Opus Clip:把長影片自動剪成 9:16 短片,含精華偵測、Whisper 字幕與自動裁切。

★ 4.9k · Python · 最後更新 2026-09

Python2short-ai-alternativeai-clip-generatorai-clipping

SandAI-org/MAGI-1

自迴歸式的大規模影片生成模型,擅長長影片的時序連貫性。

★ 3.8k · Python · 最後更新 2026-06

Pythonautoregressivediffusion-modelsvideo-generation

NExT-GPT/NExT-GPT

任意模態轉任意模態的多模態大模型,文字、圖片、影片、音訊都能互轉。

★ 3.6k · Python · 最後更新 2025-05

Pythonchatgptfoundation-modelsgpt-4

Soul-AILab/SoulX-Podcast

從文字生成高擬真播客的推論程式碼,支援多說話者與自然對話節奏。

★ 3.5k · Python · 最後更新 2025-12

Python

QwenLM/Qwen3-ASR

通義千問的開源語音辨識模型系列,支援多語言、音樂與歌曲辨識和語種偵測。

★ 3.5k · Python · 最後更新 2026-06

Python

MiniMax-AI/MiniMax-01

MiniMax 基於線性注意力的文字與視覺語言模型,主打超長脈絡。

★ 3.5k · Python · 最後更新 2025-07

Pythonlarge-language-modelsllmllms

chenyme/Chenyme-AAVT

全自動影音翻譯:Whisper 辨識、大模型翻字幕、再合併回影片。

★ 3.1k · Python · 最後更新 2025-04

Pythonfaster-whispergpt-4gpt-4oarchived

axcore/tartube

youtube-dl 的圖形介面前端,用 Python 與 GTK 寫成,批次下載管理方便。

★ 3.1k · Python · 最後更新 2026-07

Python

LeeJunHyun/Image_Segmentation

U-Net、R2U-Net、Attention U-Net 等醫學影像分割模型的 PyTorch 實作。

★ 3.1k · Python · 最後更新 2023-06

Python

Tramac/awesome-semantic-segmentation-pytorch

PyTorch 語意分割模型大集合,FCN、PSPNet、DeepLabv3+ 等二十多種一次收齊。

★ 3.1k · Python · 最後更新 2023-01

Pythonpytorchsemantic-segmentation

bytedance/InfiniteYou

字節跳動的人像重繪模型,換場景換風格但保持你的長相不走鐘。

★ 2.7k · Python · 最後更新 2025-08

Pythondiffusersdiffusiondiffusion-transformer

miantiao-me/hacker-podcast

每天自動抓 Hacker News 熱門文章,用 AI 生成中文摘要再轉成播客。

★ 2.6k · TypeScript · 最後更新 2026-09

TypeScriptaiai-agentai-workflow

alecm20/story-flicks

用大模型一鍵生成高畫質故事短片,腳本、配圖、配音一次搞定。

★ 2.5k · Python · 最後更新 2025-03

Pythonai-videoai-video-generatorchatgpt

harry0703/AudioNotes

快速把影音內容抽出來整理成結構化的 Markdown 筆記。

★ 2.5k · Python · 最後更新 2026-08

Pythonaiasrfunasr

PKU-YuanGroup/LLaVA-CoT

能自發進行系統性推理的視覺語言模型,把思考鏈帶進看圖回答。

★ 2.1k · Python · 最後更新 2025-12

Python

QwenLM/Qwen2-Audio

阿里雲通義千問的大型音訊語言模型,可直接聽音檔對話。

★ 2.1k · Python · 最後更新 2025-04

Python

Hao0321/video-autopilot-kit

自己填資料的 YouTube 短影片自動化框架:剪映 JSON 加 ffmpeg 工具鏈,不含任何私人資料。

★ 2.1k · Python · 最後更新 2026-08

Pythoncapcutcontent-creationcreator-tools

wwbin2017/bailing

類 GPT-4o 的語音對話機器人,ASR + LLM + TTS 串起來,延遲低到 800ms,可打斷,低配 Mac 也跑得動。

★ 1.8k · Python · 最後更新 2026-04

Pythonaiasrchatgpt

FoloUp/FoloUp

自架的 AI 語音面試官,替招募流程做初步篩選。

★ 1.3k · TypeScript · 最後更新 2026-05

TypeScripthiringinterviewingrecruiting

aTrainTranscription/aTrain

離線語音轉錄的圖形介面工具,含說話者分離,資料完全不出本機。

★ 1.2k · Python · 最後更新 2026-09

Python

senstella/parakeet-mlx

用 MLX 把 NVIDIA Parakeet 語音辨識模型搬到 Apple Silicon 上跑。

★ 977 · Python · 最後更新 2026-08

Python

ImprintLab/Medical-SAM2

把 Segment Anything 2 用在 3D 醫學影像分割上。

★ 930 · Python · 最後更新 2025-01

Pythondeep-learningmedicalmedical-imaging

DataoceanAI/Dolphin

多語言多任務的語音辨識模型,由海天瑞聲與清華大學共同訓練。

★ 787 · Python · 最後更新 2026-06

Python

imelnyk/ArxivPapers

把 arXiv 論文自動轉成講解影片的程式碼。

★ 544 · Python · 最後更新 2024-04

Python

chrischoy/WhisperChain

語音轉文字加上 AI 潤稿:自動清掉贅詞、修飾語句,輸出可直接用的文字。

★ 332 · Python · 最後更新 2025-02

Python

AS-AIGC/TranscriptHub

逐字稿處理平台,把語音內容集中管理與轉錄。

★ 245 · JavaScript · 最後更新 2026-06

JavaScript

PCL-Voice/PengChengStarling

基於 icefall 開發多語言 ASR 模型的完整流程,含資料處理、訓練與部署。

★ 190 · Python · 最後更新 2025-03

Python

thepersonalaicompany/amurex-backend

Amurex AI 會議助理專案的後端程式碼。

★ 147 · Python · 最後更新 2025-04

Python

hanifabd/voice-activity-detection-vad-realtime

即時語音活動偵測(VAD),附語音機器人與即時轉錄的使用範例。

★ 114 · Python · 最後更新 2025-08

Pythonlive-transcriptmachine-learningrealtime-transcribe

deepbeepmeep/Cosmos1GP

把 NVIDIA Cosmos 世界模型最佳化到消費級顯示卡也跑得動的版本。

★ 92 · Python · 最後更新 2025-02

Python

mtkresearch/generative-fusion-decoding

聯發科研究院的生成融合解碼:把 LLM 接進 ASR 與 OCR 的辨識流程來提升準確度。

★ 87 · Python · 最後更新 2025-07

Python

Winston774/ai-music-channel-starter

AI 音樂 YouTube 頻道的自動化起手包:生成、審查、上傳與數據追蹤。

★ 53 · TypeScript · 最後更新 2026-05

TypeScript

Farzad-R/Finetune-LLAVA-NEXT

微調 LLAVA-1.6-7b-mistral 多模態模型的完整程式碼。

★ 41 · Jupyter Notebook · 最後更新 2024-11

Jupyter Notebook

HighCWu/flux-4bit

把 FLUX 生圖模型量化到 4bit,讓小顯存也能跑。

★ 23 · Jupyter Notebook · 最後更新 2024-08

Jupyter Notebook

myyang19770915/MOSS-ASR

串流語音辨識加上 LLM 智慧比對校稿,提升逐字稿正確率。

★ 20 · Python · 最後更新 2026-09

Python

ChihchengHsieh/Multimodal-Medical-Diagnosis-System

多模態醫療診斷系統的研究實作。

★ 11 · Jupyter Notebook · 最後更新 2022-03

Jupyter Notebook

English