Comfy-Org/ComfyUI
最強的節點式擴散模型工作流介面,把生圖流程拆成可視化的節點圖自由串接。
★ 132.1k · Python · 最後更新 2026-09
Pythonaicomfycomfyui
harry0703/MoneyPrinterTurbo
輸入一個主題或關鍵字,自動用 AI 生成高畫質短影片(腳本、配音、字幕、素材一條龍)。
★ 121.5k · Python · 最後更新 2026-09
Pythonai-video-generatorcontent-creationffmpeg
RVC-Boss/GPT-SoVITS
只要 1 分鐘語音資料就能訓練出好用的 TTS 模型,少樣本語音克隆的代表作。
★ 61.7k · Python · 最後更新 2026-08
Pythontext-to-speechttsvits
remotion-dev/remotion
用 React 寫程式來產生影片,把影片當成可版控、可參數化的元件。
★ 58.6k · TypeScript · 最後更新 2026-09
TypeScriptjavascriptreactvideo
microsoft/VibeVoice
微軟開源的前沿語音 AI 模型,主打長篇、多說話者的自然語音生成。
★ 54k · Python · 最後更新 2026-09
Python
suno-ai/bark
文字驅動的生成式音訊模型,除了說話還能生笑聲、歌聲與環境音。
★ 39.3k · Jupyter Notebook · 最後更新 2024-08
Jupyter Notebook
OpenBMB/VoxCPM
免 tokenizer 的多語言 TTS,支援創意音色設計與高擬真語音克隆。
★ 36.9k · Python · 最後更新 2026-09
Pythonaudiodeeplearningminicpm
Zackriya-Solutions/meetily
隱私優先的 AI 會議助理:本機即時轉錄、分辨說話者、用 Ollama 摘要,完全不上雲。
★ 30.5k · Rust · 最後更新 2026-09
Rustaiai-meeting-assistantllm
hpcaitech/Open-Sora
開源版 Sora,讓一般人也能用得起的高效率影片生成模型與訓練流程。
★ 29.7k · Python · 最後更新 2026-04
Python
ATH-MaaS/Pixelle-Video
全自動短影片生成引擎,串起 ComfyUI 生圖、TTS 配音與影片合成。
★ 27.9k · Python · 最後更新 2026-06
Pythonaigccomfyuiimage-generation
resemble-ai/chatterbox
目前效果最好的開源 TTS 之一,支援情緒誇張度控制。
★ 26.3k · Python · 最後更新 2026-07
Python
SYSTRAN/faster-whisper
用 CTranslate2 重寫的 Whisper,速度快數倍、記憶體省很多,是本機轉錄的首選。
★ 25.3k · Python · 最後更新 2025-11
Pythondeep-learninginferenceopenai
QwenLM/Qwen3-VL
通義千問團隊的 Qwen3-VL 多模態大模型系列,看得懂圖片與影片。
★ 19.9k · Jupyter Notebook · 最後更新 2026-01
Jupyter Notebook
facebookresearch/sam2
Meta 的 Segment Anything 2,影像與影片都能一鍵切割任意物件。
★ 19.8k · Jupyter Notebook · 最後更新 2026-05
Jupyter Notebook
nari-labs/dia
一次生成超擬真對話的 TTS 模型,適合做多角色的口語內容。
★ 19.4k · Python · 最後更新 2025-11
Pythonaiopen-weighttext-to-speech
KlingAIResearch/LivePortrait
讓靜態人像動起來:高效率的表情與頭部動作驅動,可用來做數位人。
★ 19k · Python · 最後更新 2026-06
Pythonface-animationimage-animationvideo-editing
BradyFU/Awesome-Multimodal-Large-Language-Models
多模態大模型的最新進展彙整,論文、榜單、資源持續更新。
★ 18k · — · 最後更新 2026-09
chain-of-thoughtin-context-learninginstruction-following
deepseek-ai/Janus
DeepSeek 的統一多模態模型,理解與生成用同一套架構處理。
★ 17.8k · Python · 最後更新 2025-02
Pythonany-to-anyfoundation-modelsllm
Wan-Video/Wan2.1
阿里的開源大規模影片生成模型,消費級顯示卡也跑得動。
★ 16.9k · Python · 最後更新 2026-03
Pythonaigcvideogeneration
datawhalechina/leedl-tutorial
李宏毅深度學習課程的完整中文筆記(蘋果書),華語圈最受歡迎的深度學習入門教材之一。
★ 16.8k · Jupyter Notebook · 最後更新 2025-11
Jupyter Notebookbertchatgptcnn
SWivid/F5-TTS
用 Flow Matching 做的高擬真 TTS,合成速度與自然度都很突出。
★ 15.2k · Python · 最後更新 2026-07
Python
duixcom/Duix-Avatar
真正開源的數位人工具包,可離線生成影片與克隆數位分身。
★ 15.1k · C · 最後更新 2026-04
Cai-avatarai-avatarscloning
microsoft/TRELLIS
微軟的 3D 生成模型,從文字或圖片產生高品質 3D 資產。
★ 13.6k · Python · 最後更新 2026-06
Python3d3d-aigc3d-generation
Vaibhavs10/insanely-fast-whisper
把 Whisper 榨到極快的推論腳本,幾分鐘轉完數小時音檔。
★ 13.1k · Jupyter Notebook · 最後更新 2025-10
Jupyter Notebook
ace-step/ACE-Step-1.5
本機跑的音樂生成模型,效果勝過多數商用方案,Mac、AMD、Intel、CUDA 都支援。
★ 12.6k · Python · 最後更新 2026-09
Pythontext2music
rany2/edge-tts
不用 Edge、不用 Windows、不用 API key,直接從 Python 呼叫微軟 Edge 的線上 TTS。
★ 11.9k · Python · 最後更新 2026-03
Pythonspeech-synthesistext-to-speechtts
qubvel-org/segmentation_models.pytorch
語意分割模型庫,500+ 預訓練骨幹網路,換一行就換模型。
★ 11.7k · Python · 最後更新 2026-09
Pythoncomputer-visiondeeplab-v3-plusdeeplabv3
QuentinFuxa/WhisperLiveKit
本機即時語音轉文字:串流 ASR、分辨說話者、即時翻譯,API 相容 OpenAI 與 Deepgram。
★ 11k · Python · 最後更新 2026-09
Pythonautomatic-speech-recognitionfastapipython
SparkAudio/Spark-TTS
Spark-TTS 的推論程式碼,基於 LLM 架構的高品質語音合成。
★ 11k · Python · 最後更新 2025-04
Python
KoljaB/RealtimeSTT
低延遲的即時語音轉文字函式庫,內建語音活動偵測與喚醒詞。
★ 10.1k · Python · 最後更新 2026-08
Pythonpythonrealtimespeech-to-text
PeterL1n/RobustVideoMatting
穩健的即時影片去背,支援 PyTorch、TensorFlow.js、ONNX、CoreML 多種部署。
★ 9.5k · Python · 最後更新 2024-04
Pythonaicomputer-visiondeep-learning
deepbeepmeep/Wan2GP
為顯示卡不夠力的人最佳化的影片生成器,支援 Wan、LTX、Hunyuan、Flux 等多種模型。
★ 9.2k · Python · 最後更新 2026-09
Pythonaifluxflux2
studio-dots-ai/dots.ocr
用單一視覺語言模型做多語言文件版面解析,一次搞定 OCR 與結構還原。
★ 9.1k · Python · 最後更新 2026-03
Python
jianchang512/clone-voice
帶網頁介面的聲音克隆工具,用你的音色或任意聲音錄製音檔。
★ 9k · Python · 最後更新 2025-08
Pythonclonevoicespeech-analysisstsarchived
JimmyLv/awesome-nano-banana
Gemini 2.5 Flash Image(Nano Banana)生成圖與提示詞的精選集,想學怎麼下圖片 prompt 看這個。
★ 8.8k · JavaScript · 最後更新 2025-09
JavaScriptchatgptflux-kontextgemini-2-5-flash-image
boson-ai/higgs-audio
Boson AI 的文字—音訊基礎模型,語音生成與理解共用同一套骨幹。
★ 8.3k · Python · 最後更新 2026-06
Python
jamez-bondos/awesome-gpt4o-images
GPT-4o 與 gpt-image-1 生成圖片與提示詞的精選集,看範例學怎麼描述畫面。
★ 8.1k · JavaScript · 最後更新 2025-05
JavaScriptai-artai-image-examplesanime-ai-art
Zyphra/Zonos
用 20 萬小時多語言語音訓練的開放權重 TTS,表現力與品質接近商用等級。
★ 7.2k · Python · 最後更新 2025-03
Python
ngxson/smolvlm-realtime-webcam
用 SmolVLM 加 llama.cpp 做的即時鏡頭視覺理解 demo。
★ 5.6k · HTML · 最後更新 2025-05
HTML
modstart-lib/aigcpanel
一站式的 AI 數位人系統,影片合成、聲音合成、聲音克隆,本機模型一鍵匯入。
★ 5.5k · TypeScript · 最後更新 2026-09
TypeScriptaiaigccosyvoice
OHF-Voice/piper1-gpl
快速的本機神經 TTS 引擎,樹莓派等低階裝置也跑得動。
★ 5.5k · C++ · 最後更新 2026-09
C++
nICEnnnnnnnLee/BilibiliDown
B 站影片下載器(圖形介面),支援稍後再看、收藏夾與 UP 主批次下載。
★ 5.3k · Java · 最後更新 2026-07
Javabilibilicookiedownload-videos
Anil-matcha/AI-Youtube-Shorts-Generator
開源版 Opus Clip:把長影片自動剪成 9:16 短片,含精華偵測、Whisper 字幕與自動裁切。
★ 4.9k · Python · 最後更新 2026-09
Python2short-ai-alternativeai-clip-generatorai-clipping
SandAI-org/MAGI-1
自迴歸式的大規模影片生成模型,擅長長影片的時序連貫性。
★ 3.8k · Python · 最後更新 2026-06
Pythonautoregressivediffusion-modelsvideo-generation
NExT-GPT/NExT-GPT
任意模態轉任意模態的多模態大模型,文字、圖片、影片、音訊都能互轉。
★ 3.6k · Python · 最後更新 2025-05
Pythonchatgptfoundation-modelsgpt-4
Soul-AILab/SoulX-Podcast
從文字生成高擬真播客的推論程式碼,支援多說話者與自然對話節奏。
★ 3.5k · Python · 最後更新 2025-12
Python
QwenLM/Qwen3-ASR
通義千問的開源語音辨識模型系列,支援多語言、音樂與歌曲辨識和語種偵測。
★ 3.5k · Python · 最後更新 2026-06
Python
MiniMax-AI/MiniMax-01
MiniMax 基於線性注意力的文字與視覺語言模型,主打超長脈絡。
★ 3.5k · Python · 最後更新 2025-07
Pythonlarge-language-modelsllmllms
chenyme/Chenyme-AAVT
全自動影音翻譯:Whisper 辨識、大模型翻字幕、再合併回影片。
★ 3.1k · Python · 最後更新 2025-04
Pythonfaster-whispergpt-4gpt-4oarchived
axcore/tartube
youtube-dl 的圖形介面前端,用 Python 與 GTK 寫成,批次下載管理方便。
★ 3.1k · Python · 最後更新 2026-07
Python
LeeJunHyun/Image_Segmentation
U-Net、R2U-Net、Attention U-Net 等醫學影像分割模型的 PyTorch 實作。
★ 3.1k · Python · 最後更新 2023-06
Python
Tramac/awesome-semantic-segmentation-pytorch
PyTorch 語意分割模型大集合,FCN、PSPNet、DeepLabv3+ 等二十多種一次收齊。
★ 3.1k · Python · 最後更新 2023-01
Pythonpytorchsemantic-segmentation
bytedance/InfiniteYou
字節跳動的人像重繪模型,換場景換風格但保持你的長相不走鐘。
★ 2.7k · Python · 最後更新 2025-08
Pythondiffusersdiffusiondiffusion-transformer
miantiao-me/hacker-podcast
每天自動抓 Hacker News 熱門文章,用 AI 生成中文摘要再轉成播客。
★ 2.6k · TypeScript · 最後更新 2026-09
TypeScriptaiai-agentai-workflow
alecm20/story-flicks
用大模型一鍵生成高畫質故事短片,腳本、配圖、配音一次搞定。
★ 2.5k · Python · 最後更新 2025-03
Pythonai-videoai-video-generatorchatgpt
harry0703/AudioNotes
快速把影音內容抽出來整理成結構化的 Markdown 筆記。
★ 2.5k · Python · 最後更新 2026-08
Pythonaiasrfunasr
PKU-YuanGroup/LLaVA-CoT
能自發進行系統性推理的視覺語言模型,把思考鏈帶進看圖回答。
★ 2.1k · Python · 最後更新 2025-12
Python
QwenLM/Qwen2-Audio
阿里雲通義千問的大型音訊語言模型,可直接聽音檔對話。
★ 2.1k · Python · 最後更新 2025-04
Python
Hao0321/video-autopilot-kit
自己填資料的 YouTube 短影片自動化框架:剪映 JSON 加 ffmpeg 工具鏈,不含任何私人資料。
★ 2.1k · Python · 最後更新 2026-08
Pythoncapcutcontent-creationcreator-tools
wwbin2017/bailing
類 GPT-4o 的語音對話機器人,ASR + LLM + TTS 串起來,延遲低到 800ms,可打斷,低配 Mac 也跑得動。
★ 1.8k · Python · 最後更新 2026-04
Pythonaiasrchatgpt
FoloUp/FoloUp
自架的 AI 語音面試官,替招募流程做初步篩選。
★ 1.3k · TypeScript · 最後更新 2026-05
TypeScripthiringinterviewingrecruiting
aTrainTranscription/aTrain
離線語音轉錄的圖形介面工具,含說話者分離,資料完全不出本機。
★ 1.2k · Python · 最後更新 2026-09
Python
senstella/parakeet-mlx
用 MLX 把 NVIDIA Parakeet 語音辨識模型搬到 Apple Silicon 上跑。
★ 977 · Python · 最後更新 2026-08
Python
ImprintLab/Medical-SAM2
把 Segment Anything 2 用在 3D 醫學影像分割上。
★ 930 · Python · 最後更新 2025-01
Pythondeep-learningmedicalmedical-imaging
DataoceanAI/Dolphin
多語言多任務的語音辨識模型,由海天瑞聲與清華大學共同訓練。
★ 787 · Python · 最後更新 2026-06
Python
imelnyk/ArxivPapers
把 arXiv 論文自動轉成講解影片的程式碼。
★ 544 · Python · 最後更新 2024-04
Python
chrischoy/WhisperChain
語音轉文字加上 AI 潤稿:自動清掉贅詞、修飾語句,輸出可直接用的文字。
★ 332 · Python · 最後更新 2025-02
Python
AS-AIGC/TranscriptHub
逐字稿處理平台,把語音內容集中管理與轉錄。
★ 245 · JavaScript · 最後更新 2026-06
JavaScript
PCL-Voice/PengChengStarling
基於 icefall 開發多語言 ASR 模型的完整流程,含資料處理、訓練與部署。
★ 190 · Python · 最後更新 2025-03
Python
thepersonalaicompany/amurex-backend
Amurex AI 會議助理專案的後端程式碼。
★ 147 · Python · 最後更新 2025-04
Python
hanifabd/voice-activity-detection-vad-realtime
即時語音活動偵測(VAD),附語音機器人與即時轉錄的使用範例。
★ 114 · Python · 最後更新 2025-08
Pythonlive-transcriptmachine-learningrealtime-transcribe
deepbeepmeep/Cosmos1GP
把 NVIDIA Cosmos 世界模型最佳化到消費級顯示卡也跑得動的版本。
★ 92 · Python · 最後更新 2025-02
Python
mtkresearch/generative-fusion-decoding
聯發科研究院的生成融合解碼:把 LLM 接進 ASR 與 OCR 的辨識流程來提升準確度。
★ 87 · Python · 最後更新 2025-07
Python
Winston774/ai-music-channel-starter
AI 音樂 YouTube 頻道的自動化起手包:生成、審查、上傳與數據追蹤。
★ 53 · TypeScript · 最後更新 2026-05
TypeScript
Farzad-R/Finetune-LLAVA-NEXT
微調 LLAVA-1.6-7b-mistral 多模態模型的完整程式碼。
★ 41 · Jupyter Notebook · 最後更新 2024-11
Jupyter Notebook
HighCWu/flux-4bit
把 FLUX 生圖模型量化到 4bit,讓小顯存也能跑。
★ 23 · Jupyter Notebook · 最後更新 2024-08
Jupyter Notebook
myyang19770915/MOSS-ASR
串流語音辨識加上 LLM 智慧比對校稿,提升逐字稿正確率。
★ 20 · Python · 最後更新 2026-09
Python
ChihchengHsieh/Multimodal-Medical-Diagnosis-System
多模態醫療診斷系統的研究實作。
★ 11 · Jupyter Notebook · 最後更新 2022-03
Jupyter Notebook