🆕 24个AI模型本地部署 · 智能调度 · 零门槛

几句话替代工作流
一句话生成GUI软件

本地部署24个AI模型同时运行,智能调度GPU显存。全免费方案:AI模型开源免费、客户端免费、内置LLM免费、生成软件免费、无限复用免费。告别Coze拖40个节点 —— 几句中文完成从语音识别→翻译→换脸→去水印→超分辨率→字幕生成→视频合成的全自动流水线。API足够稳定清晰,智障模型也能零误差执行。

迅雷云盘下载 百度网盘下载 夸克网盘下载

迅雷提取码: pq3v  |  百度提取码: gwmc  |  夸克: 直接访问  |  VS Coze工作流对比 →

兼容: 🤖 Codex 🔧 WorkBuddy 🧠 Claude Code 🔗 Hermes 🦞 OpenClaw ⚡ Trae 📡 REST API 🐍 Python SDK
🔥 颠覆工作流
几句话 VS 几十个节点

同一任务,Coze需要手动搭建40+节点的工作流,100000.plus只需要一句中文。

🔶 Coze工作流方案

节点1 → 视频拆帧
节点2 → NSFW图片检测
节点3 → 条件分支(违规?)
节点4 → 语音提取
节点5 → Whisper转文字
节点6 → 翻译API
节点7 → TTS合成语音
节点8 → 裁剪违规片段
节点9 → 字幕合成
节点10 → 格式转码
还需要 30+ 节点

需要配置节点参数、字段映射、条件逻辑、错误处理...耗时数小时,还容易出错。

🟢 100000.plus 方案

"检测【直播录像.mp4】中有无不适宜画面,自动切掉违规片段,把剩下的语音转成中英文双语字幕合成到视频里,输出1080p H.265成品。"

一行中文 → 自动编排10步流水线 → 无需任何配置

40+
Coze需搭建节点
1
100000.plus需中文句子
0
需编程知识
100%
本地处理不出网
💰 Token极限省
几毛钱生成一个软件,然后永久免费

为什么100000.plus能省90%+ Token?因为它的API不是模糊的自然语言桥接,而是精确、稳定、有类型的函数调用

🔶 传统LLM调工具

用自然语言描述调用whisper,每次都要写"请把音频转成文字,采样率16k,输出格式srt,中文识别..."

→ LLM每次都要揣摩你的意图
→ 参数容易传错或遗漏
→ 出错了要重新生成全量Token
智能模型(GPT-4/Claude)才能勉强用
智障模型根本玩不转

🟢 100000.plusFunction Call Schema

{"name": "whisper",
"params": {"audio": "<file>",
"model": "large-v3", "lang": "zh"},
"returns": "srt + txt"}

→ 模型只需选择函数名,不用描述过程
→ Schema保证参数类型,不会传错
→ 一次生成含10步流水线的脚本,仅耗3K Token
智障模型也能零误差执行

30K+
传统方案Token消耗
3K
100000.plus Token消耗
90%+
费用节省
生成后免费使用

算一笔账: 生成的短视频二创工具 = 一次消耗约¥0.3 Token
每天用100次,一年用3万次 = ¥0.3(因为软件已在本地,不再消耗Token)
如果每次都用云端AI处理 = 3万次 × ¥2/次 = ¥60,000
费用差 20 万倍。省下的钱够买一块 4090。

🆓
AI模型免费
Whisper、Florence-2、Real-ESRGAN、YOLO、EasyOCR等24个模型全部开源免费,无任何授权费
🔑
自带DeepSeek Key
使用内置LLM服务零成本起步,也可在设置中填入自己的API Key,全流程无隐藏费用
🔒
数据不出本地
所有AI推理在你的电脑上完成,视频图片音频永远不传到任何服务器
一句话等于一个高级自动化工坊

下面每个任务,在传统工具里需要编排几十个节点、写几百行代码。在100000.plus里,就是一句话。

🎬 短视频全自动二创
1
把【产品发布会.mp4】自动切分成镜头,AI识别每个镜头里有什么内容和人物,筛选出有人脸特写且声音清晰的10个镜头,AI换脸替换为主播的脸,去水印去掉画面上的台标,文字转语音重新配音,自动匹配口型时长,超分辨率提升到4K画质,最后加片头片尾合成15秒带货短视频。
Florence-2 场景识别 Whisper 语音分析 场景切割 NSFW 内容审核 ReActor 换脸 去水印 TTS 配音 音文对齐 口型匹配 Real-ESRGAN 4K超分 视频合成+编码
🌍 多语言视频翻译流水线
2
把英文演讲视频【talk.mp4】提取音频转文字,同时AI识别画面中的PPT文字并OCR翻译,语音翻译成中文、日文、韩文,用AI语音克隆原说话人的音色合成三种语言的配音,按每种语言的字幕时长自动调速画面,AI去除原视频内嵌的硬字幕,合成三语版本视频输出。
Whisper 语音识别 Florence-2 OCR GPT翻译 声音克隆 TTS×3 音文对齐 去水印/硬字幕 三路合成+字幕渲染
📊 会议全媒体自动纪要
3
把3小时会议录像【meeting.mp4】提取所有人声转文字,AI按声纹区分8位发言人,检测每个人发言时画面中的PPT幻灯片并OCR提取文字,AI总结会议要点和待办事项,生成带时间戳+发言人标签+PPT截图的会议纪要文档,同时自动切出每个议题的5分钟精华片段,输出带字幕的快速回顾视频。
Whisper 语音转写 FunASR 声纹分离 Florence-2 PPT OCR GPT 会议摘要 NSFW 内容审核 智能片段截取 字幕合成
🖼 电商产品图批量精修
4
把【产品图文件夹】里所有图片,AI自动检测并裁掉不适宜内容,背景移除替换为纯白,放大4倍超分辨率,检测画面中的文字区域并翻译成英文和日文覆盖到图上,统一添加产品编号水印,按品类自动分类到不同输出文件夹,最后用浏览器直接预览对比原图和精修后的效果。
NSFW 内容扫描 RMBG 背景移除 Real-ESRGAN 超分辨率 Florence-2 OCR翻译 Florence-2 自动分类 图片合成+编码
🎤 播客全平台自动化
5
把两人对话播客【podcast.wav】用AI声纹分离两位主持人,分别转文字并标注谁在说话,AI检测音频中的笑声掌声和沉默段落并自动剪掉超长静音,AI总结本期话题生成吸引人的标题和200字文案,AI换声把男主持声音换成温柔女声,生成16:9横屏音频可视化视频+9:16竖屏字幕版适配抖音B站YouTube三平台输出。
FunASR 声纹分离 Whisper 语音转写 VAD 静音检测/剪辑 GPT 标题+文案生成 声音克隆 换声 音频可视化+多比例编码
📚 网课视频智能增强
6
把【网课录像.mp4】AI检测画面中的PPT区域并超分辨率放大确保文字清晰,同时检测板书手写文字并OCR提取,去水印去掉平台Logo,检测老师在视频中出现的帧做换脸保护隐私,PPT翻页时自动生成章节标记,所有语音转文字生成带章节跳转的SRT字幕,输出学习笔记文档+带导航字幕的增强版视频。
Florence-2 PPT区域检测 Real-ESRGAN 文字增强 Florence-2 OCR 去水印 ReActor 隐私换脸 Florence-2 翻页检测 Whisper 语音转写 章节字幕合成
📱 批量素材安全检查+归档
7
检查【素材库文件夹】所有视频和图片,NSFW检测标记违规文件移到隔离区,检测所有视频的清晰度低于720p的用AI超分到1080p,检测重复视频(包括裁剪版和加速版)标记相似文件,按内容类型(人物/风景/产品/文字)AI自动分类到子文件夹,生成带缩略图和标签的素材目录索引页面。
NSFW 逐帧检测 Florence-2 图像分类 Real-ESRGAN 批量超分 VDF 重复检测 自动归档+索引生成
🎵 老唱片数字化修复
8
把【老唱片录音.wav】音频AI降噪去除底噪和爆音,分离人声和伴奏,AI修复破音和失真,超分辨率提升采样率到48kHz,同时AI生成匹配时代风格的封面图,用AI合成主播嗓音把歌词重新演唱替代原人声,生成带字幕+封面的音乐视频,输出无损FLAC音频+4K MV视频。
音频降噪+分离 TTS 声音克隆演唱 Z-Image 封面生成 音频重采样 48kHz Whisper 歌词提取 字幕+封面合成MV
📡 监控录像智能回溯
9
扫描【监控文件夹】24小时录像,AI检测异常画面:人群突然聚集、物品被移动、画面长时间静止(摄像头故障)、光线突变(开关灯),标记所有异常时间点自动截图,把异常片段前后各30秒裁剪出来合成异常事件集锦视频,在截图上用红框标注检测到的异常区域,生成带时间线的异常报告。
Florence-2 人群检测 Florence-2 物体变化检测 VAD 静帧检测 帧差分析+片段截取 事件集锦合成+标注
🎮 游戏直播高光自动剪辑
10
分析【游戏直播录像.mp4】,AI检测弹幕密集时段+观众笑声+主播情绪激动语音+画面快速变化(击杀/胜利场景),综合打分筛选Top10高光时刻,自动剪辑各30秒片段,AI生成每段的精彩标题文字叠加到画面上,背景音乐自动卡点切换,去水印去掉平台logo,超分辨率提升画质,合成3分钟高光合集视频。
Whisper 语音情绪分析 Florence-2 画面变化检测 FunASR 笑声检测 去水印 Real-ESRGAN 画质增强 GPT 标题生成 多片段合成+背景音乐
本地AI模型矩阵

以下模型全部本地部署,通过统一API调用,支持智能GPU调度、模型热切换、批量并发处理

🎤
Whisper
语音转文字 · 6尺寸
📝
FunASR
中文语音识别 · VAD
🔞
NSFW检测
图片内容审核 · 3分类
🔍
Real-ESRGAN
超分辨率 · 3模型
👁
Florence-2
视觉识别 · 14种任务
RMBG
背景移除 · 透明PNG
😊
ReActor
AI换脸 · 人脸检测
🎬
去水印
视频字幕/水印去除
📐
音文对齐
Qwen3 · 词级时间戳
🔊
MOSS-TTS
语音合成 · 48kHz
🎵
Qwen3-TTS
语音克隆 · 3模式
🎶
dots.tts
连续AR合成 · 48kHz
🔗
VDF
视频重复检测 · pHash
🤖
GPT-SoVITS
全自动语音克隆
🎨
Z-Image
文生图 · 6B参数
👁️
YOLO26n
目标检测 · 5任务
🏷️
WD14标签
AI图片标签 · 11模型
🔤
EasyOCR
多语言OCR · 21语言
🎞️
RIFE插帧
视频帧插值 · 2-4倍
🤖
SmolVLM2
视觉问答 · 6B参数
🔊
NovaSR
音频超分 · 16k→48k
🎙
FireRedASR2
SOTA语音识别
🗣
Qwen3-ASR
52语言 · 自动检测
超越命令行

不仅是AI模型调用 —— 更是一个完整的本地AI工作站

🧠

自然语言驱动

用中文描述需求,自动拆解成10+步AI流水线。支持多模型联动、条件分支、失败重试。

24模型智能调度

GPU显存自动管理,LRU淘汰策略。模型按需加载/卸载,16GB显存同时运行6个模型不OOM。

一键生成GUI软件

把处理任务一键打包成带界面的独立.exe程序。非程序员也能发布自己的AI软件工具。

🔌

Agent兼容

通过REST API接入Codex、WorkBuddy、Hermes、OpenClaw、Claude Code、Trae等AI编程助手。标准HTTP接口,任何语言都能调用。

📦

批量并发处理

整目录批量处理,多模型并发推理。万级文件自动分片并行,充分利用GPU资源。

🔒

完全本地部署

所有AI模型运行在你的电脑上,数据不出本地。支持离线运行,无需网络。

开放API · 任意集成

通过标准REST API接入任何AI Agent或编程工具

# Codex / WorkBuddy / Hermes / Claude Code / Trae / OpenClaw 调用示例 curl -u admin:pass http://127.0.0.1:9003/plugin/whisper/infer -F audio=@speech.wav curl -u admin:pass http://127.0.0.1:9003/plugin/nsfw/infer -F image=@photo.jpg curl -u admin:pass http://127.0.0.1:9003/plugin/realesrgan/infer -F image=@small.jpg -F outscale=4 # 24个插件全部支持,统一认证,统一格式
支持AI Agent: 🤖 Codex CLI 🔧 WorkBuddy 🧠 Claude Code 🔗 Hermes 🦞 OpenClaw ⚡ Trae 📡 任意HTTP客户端 🐍 Python requests
命令词汇手册

掌握这些词汇后,任意组合即可描述复杂流水线。不用猜API支不支持 —— 下面出现的都能直接执行。配置选项都用粗体标注,方便识别。

🎤 Whisper 语音转文字

6种模型尺寸 · 4种输出格式 · 多语言 · 批量
模型尺寸 —— 越大越准,越小越快
把【meeting.wav】转成中文文字,用 tiny 模型 # 最快,适合实时 把【speech.mp3】转成英文文字,用 base 模型 # 轻度使用 把【lecture.wav】转成中文文字,用 small 模型 # 日常够用 把【podcast.mp3】转成中文文字,用 medium 模型 # 高准确率 把【interview.wav】转成中文文字,用 large-v2 模型 # 专业级 把【movie.wav】转成中文文字,用 large-v3 模型 # 最高精度
输出格式
把【speech.wav】转成中文 纯文字输出TXT 把【speech.wav】转成中文 SRT字幕,带精确时间戳 把【speech.wav】转成中文 VTT字幕,用于网页播放器 把【speech.wav】转成 JSON格式,包含每句话的起止时间
语言选项
把【speech.wav】转成 中文 文字 把【speech.wav】转成 英文 文字 把【speech.wav】转成 日文 文字 把【speech.wav】转成 韩文 文字 把【speech.wav】自动检测语言并转文字
批量处理
文件夹【C:/recordings】里所有音频批量转成中文SRT字幕,用large-v3模型 文件夹【C:/mp3】里所有MP3批量转英文纯文本,用medium模型 遍历【D:/calls】下所有wav文件,自动检测语言转成VTT字幕

📝 FunASR 中文语音识别

VAD静音分段 · 标点恢复 · 热词增强 · 声纹分离
识别 & 分句
用FunASR把【speech.wav】转中文,开启VAD自动分段 用FunASR把【speech.wav】转中文,开启标点恢复自动加逗号句号 用FunASR把【speech.wav】转中文,不开启VAD不开启标点恢复
热词 —— 专业术语识别更准
用FunASR把【speech.wav】转中文,热词包含 "OpenCode、100000.plus、去水印" 用FunASR把【tech.mp3】转中文,热词"卷积神经网络、反向传播、梯度下降"
说话人分离
用FunASR把【meeting.wav】做声纹分离区分3个说话人 用FunASR把【interview.wav】做声纹分离区分2个说话人,同时转成中文文字

📐 音文对齐

词级时间戳 · 口型同步
把【speech.wav】和【script.txt】做音文对齐,输出每个词的时间 把【speech.wav】和【script.txt】做中文音文对齐,用于生成口型同步字幕 把【speech.wav】和【script.txt】做英文音文对齐,输出JSON格式

👁 Florence-2 视觉识别 —— 14种任务

一张图能问14种不同的问题
图片描述 —— 从概括到极详细
用Florence-2对【photo.jpg】做简要描述 # caption 用Florence-2对【photo.jpg】做详细描述 # detailed_caption 用Florence-2对【photo.jpg】做极致详细描述 # more_detailed_caption
物体检测 —— 找到图中的东西在哪
用Florence-2检测【photo.jpg】中所有物体的位置 # object_detection 用Florence-2对【photo.jpg】做密集区域描述,每个区域都描述一遍 # dense_region_caption 用Florence-2提取【photo.jpg】中所有候选区域 # region_proposal 用Florence-2在【photo.jpg】中找到"一只猫"的位置 # phrase_grounding 用Florence-2在【photo.jpg】中检测"红色的汽车"和"穿蓝色衣服的人" # open_vocabulary_detection
OCR 文字识别
用Florence-2识别【screenshot.jpg】中所有的文字 # ocr 用Florence-2识别【screenshot.jpg】中的文字并标注每段字的位置区域 # ocr_with_region
语义分割 —— 像素级物体分离
用Florence-2对【photo.jpg】做语义分割 # segmentation 用Florence-2识别【photo.jpg】中每个区域属于什么类别 # region_to_category 用Florence-2描述【photo.jpg】中每个检测到的区域 # region_to_description 用Florence-2把【photo.jpg】的描述转换成检测位置 # caption_to_phrase_grounding
批量视觉识别
用Florence-2对文件夹【C:/images】中所有图片批量做简要描述 用Florence-2对【C:/screenshots】中所有图片批量做中文OCR

🔞 NSFW 图片内容审核

五分类 · 阈值过滤 · 批量扫描 · 自动隔离
单张 & 批量检测
检测【photo.jpg】是否包含不适宜内容 检查【image.png】的内容安全性 判断【pic.jpg】属于 drawings / hentai / neutral / porn / sexy 哪一类 扫描文件夹【C:/uploads】中所有图片,NSFW检测
阈值控制 & 自动隔离
扫描文件夹【C:/photos】,违规阈值设为0.5 # 宽松 扫描文件夹【C:/photos】,违规阈值设为0.9 # 严格 扫描文件夹【C:/images】,自动把违规文件移动到隔离文件夹 扫描文件夹【C:/images】,阈值0.7,自动移动到【C:/flagged】

🔍 Real-ESRGAN 超分辨率

3种模型 · 多种放大倍数 · 视频帧批量
模型选择 —— 不同内容用不同模型
通用模型把【small.jpg】AI放大4倍 # realesr-general-x4v3,万金油 写实模型把【photo.jpg】AI放大4倍 # RealESRGAN_x4plus,适合真人照片 动漫模型把【anime.jpg】AI放大4倍 # RealESRGAN_x4plus_anime_6B,适合二次元
放大倍数
用通用模型把【small.jpg】AI放大2倍 用通用模型把【small.jpg】AI放大4倍
批量 & 视频帧处理
文件夹【C:/small_images】里所有图片用通用模型批量放大4倍 把【video.mp4】拆帧后用写实模型逐帧放大4倍,再合回视频

✂ RMBG 背景移除

透明 / 替换纯色 · 边缘优化 · 批量
背景处理选项
把【photo.jpg】去背景,输出透明PNG 把【photo.jpg】去背景,背景换成纯白色 #FFFFFF 把【photo.jpg】去背景,背景换成纯蓝色 #0000FF 把【photo.jpg】去背景,打开边缘细化让头发丝更干净 把【photo.jpg】去背景,替换成白色背景边缘细化打开 文件夹【C:/product_photos】里所有产品图批量去背景换成白色,格式换成PNG

🎬 去水印 / 去字幕

4种类型 · 位置指定 · 输出格式 · 检测
按去除类型
把【video.mp4】底部的硬字幕去掉 # subtitle,位置bottom 把【video.mp4】右下角的台标水印去掉 # watermark 把【video.mp4】画面中所有的水印和字幕都去掉 # all
指定位置
把【video.mp4】底部的硬字幕去掉 把【video.mp4】顶部的滚动字幕去掉 把【video.mp4】左侧的竖排水印去掉 把【video.mp4】中间的弹幕水印去掉 把【video.mp4】右下角的logo去掉
检测 & 输出格式
检测【video.mp4】中有哪些水印和字幕 把【video.mp4】的水印全去掉,输出MP4格式 把【video.mp4】的字幕去掉,输出AVI格式保留原始质量

😊 ReActor 换脸

图片换脸 · 视频换脸 · 多人脸选择 · 超分增强
图片换脸
把【face.jpg】的脸换到【photo.jpg】上 把【face.jpg】的脸换到【photo.jpg】上,第2张脸# 多人脸时选第几张 把【face.jpg】的脸换到【photo.jpg】上,换完后放大增强清晰度
视频换脸
把【face.jpg】的脸换到【video.mp4】的每一帧上 把【face.jpg】的脸换到【video.mp4】上,第0张脸,用4个GPU线程加速 把【face.jpg】的脸换到【video.mp4】上,换脸后把视频超分到4K画质
人脸检测
检测【photo.jpg】里有几张人脸,返回每个人的位置坐标 检测【group.jpg】里所有人脸的位置和置信度

🎬 VDF 视频重复检测

两两对比 · 库内检索 · 批量去重 · 容忍编辑
两两对比 —— 不同阈值
对比【clip.mp4】和【source.mp4】是不是同一个视频 对比【clip.mp4】和【source.mp4】,相似度阈值设0.7 # 宽松,找相关片段 对比【clip.mp4】和【source.mp4】,相似度阈值设0.95 # 严格,需几乎一样 对比【clip.mp4】和【source.mp4】,每秒采样4帧 # 提高精度
库内搜索
在素材库【C:/videos】中查找和【clip.mp4】相似的视频 在素材库【C:/videos】中查找,阈值0.7 # 找所有相关片段 在素材库【C:/videos】中查找,阈值0.95 # 只找几乎一样的
批量去重
文件夹【C:/videos】内所有视频去重只报告不删除 对文件夹【C:/videos】内所有视频去重把重复文件移动到【C:/duplicates】 对文件夹【C:/videos】内所有视频去重删除完全一样的重复文件

🔊 MOSS-TTS 语音合成

48kHz高音质 · 语速 · 不同采样率
采样率 & 语速
用MOSS-TTS把"你好,欢迎使用100000.plus"转成语音,48kHz高音质 用MOSS-TTS把"你好,欢迎使用100000.plus"转成语音,24kHz普通音质 用MOSS-TTS把"你好,欢迎使用100000.plus"转成语音,16kHz电话音质 用MOSS-TTS把"你好,欢迎使用100000.plus"转成语音,语速0.8倍慢速 用MOSS-TTS把"你好,欢迎使用100000.plus"转成语音,语速1.5倍快速 用MOSS-TTS把【script.txt】的文本内容转成48kHz高音质语音

🎵 Qwen3-TTS 语音合成 / 克隆

三种模式:指令式 · 声音克隆 · 零样本 + 情感控制
指令式 —— 无需参考音频,描述想要的音色
用Qwen3-TTS把"今天天气很好"转成语音,用指令模式 用Qwen3-TTS用温和的女声说"你好,欢迎致电客服中心" 用Qwen3-TTS用沉稳的男中音说"现在是北京时间下午三点整"
声音克隆 —— 提供参考音频模仿音色
用Qwen3-TTS用克隆模式,参考【voice.wav】的音色说"你好世界" 用Qwen3-TTS用克隆模式,参考【speaker.wav】的音色读【script.txt】 用Qwen3-TTS用克隆模式,参考【teacher.wav】的音色说"今天我们来学习机器学习"
情感 & 零样本
用Qwen3-TTS用开心的语气克隆【voice.wav】的音色说"恭喜你通过了" 用Qwen3-TTS用悲伤的语气克隆【voice.wav】的音色说"很遗憾告诉你" 用Qwen3-TTS用生气的语气克隆【voice.wav】的音色说"你给我出去" 用Qwen3-TTS用零样本模式,直接把"明天会下雨吗"说出来

🎶 dots.tts 连续AR合成

长文本 · 预设音色 · 语速
用dots.tts把【script.txt】转成语音,用女声01号音色 用dots.tts把【script.txt】转成语音,用男声03号音色,语速0.9 用dots.tts把【story.txt】全文转成语音,48kHz,语速1.0 查看dots.tts有哪些可用音色

🤖 GPT-SoVITS 全自动语音克隆

参考音频克隆 · 跨语言 · 情感
用GPT-SoVITS克隆【voice.wav】的音色说"你好,这是AI合成的语音" 用GPT-SoVITS克隆【ref.wav】的音色说"今天天气真好",参考文本是"今天天气真好" 用GPT-SoVITS用中文克隆【ref.wav】的音色说一段长文本【script.txt】 用GPT-SoVITS克隆【en_speaker.wav】的音色用英文说"Hello, nice to meet you"

👁️ YOLO26n 目标检测 / 分类 / 分割 / 姿态

5种任务 · 置信度可调 · 极轻量模型
用YOLO检测【photo.jpg】中有什么物体 # detect 用YOLO检测【photo.jpg】中的物体,置信度0.5 # 更严格 用YOLO分类【photo.jpg】属于什么类别 # classify 用YOLO分割【photo.jpg】中的物体轮廓 # segment 用YOLO检测【photo.jpg】中的人体姿态关键点 # pose

🔤 EasyOCR 多语言 OCR 文字识别

21种语言 · 纯文本/含坐标 · 离线推理
用EasyOCR识别【scan.jpg】中的英文文字 用EasyOCR识别【receipt.jpg】中的中文文字 用EasyOCR识别【label.jpg】中的日文文字 用EasyOCR识别【screenshot.jpg】中的文字,输出每行坐标

🏷️ WD14 AI 图片标签

11种ONNX模型 · 三类标签 · 阈值可调
用WD14给【photo.jpg】打标签,wd-convnext-tagger-v3模型 用WD14给【photo.jpg】打标签,阈值0.5只保留高置信度 用WD14用wd-eva02-large-tagger-v3模型打标签

🤖 SmolVLM2 视觉问答

图片理解 · 中英文 · 6B参数
用SmolVLM2分析【photo.jpg】里有什么 问SmolVLM2:"这是什么动物?" 问SmolVLM2:"室内还是室外?" 问SmolVLM2:"描述场景颜色和构图"

🎞️ RIFE 视频帧插值

帧率倍增 · 2-4× · 流畅慢动作
用RIFE把【video.mp4】从30fps插帧到60fps # 2倍流畅 用RIFE把【video.mp4】从24fps插帧到48fps 用RIFE把【video.mp4】从30fps插帧3倍到90fps

🔊 NovaSR 音频超分辨率

16kHz→48kHz · 90×实时 · ~52KB模型
用NovaSR把【audio.wav】超分到48kHz高音质 用NovaSR用v2模型提升旧录音音质 用NovaSR把文件夹所有音频批量超分到48kHz

🎨 Z-Image 文生图

正负提示词 · 尺寸 · 推理步数
用Z-Image生成一张图"一只橘猫坐在窗台上,阳光洒在它身上" 用Z-Image生成"一座未来城市的夜景"尺寸1024x1024 用Z-Image生成"卡通风格的机器人"尺寸768x768推理步数20 用Z-Image生成"一个安静的书房", 避免出现"人物、文字、模糊" 用Z-Image生成"赛博朋克的街道"尺寸1024x1024,排除"低质量、变形"步数30

📼 FFmpeg 视频 / 音频处理 (非插件,直接调用)

转码 · 裁剪 · 抽帧 · 拼接 · 字幕 · 缩放 · 变速 · 滤镜 · 音频 · 更多
转码 —— 编码 / 分辨率 / 帧率 / 码率
把【video.mp4】转成H.264编码 把【video.mp4】转成H.265编码,分辨率1920x1080 把【video.mp4】转成H.265编码,1080p,30帧,码率5Mbps 把【video.mp4】转成VP9编码用于网页播放 把【video.mp4】转成AV1编码,分辨率3840x2160 把【video.mp4】转码,视频H.265,音频AAC 128kbps,分辨率720p 转换格式【video.mkv】到MP4,保持原始质量
裁剪 —— 按时间 / 秒数
把【video.mp4】从第5秒开始截取30秒 把【video.mp4】从00:01:30开始截取到00:03:00 把【video.mp4】从第10秒开始截取60秒,保留音频 把【video.mp4】掐头去尾,去前5秒和后3秒
提取音频 —— 多种格式和参数
从【video.mp4】提取音频保存为MP3 从【video.mp4】提取音频保存为WAV无损 从【video.mp4】提取音频保存为16kHz单声道WAV,用于Whisper识别 从【video.mp4】提取音频保存为FLAC无损压缩 从【video.mp4】提取音频并自动音量归一化
抽帧 —— 不同频率 / 尺寸
把【video.mp4】每秒抽1帧保存为PNG 把【video.mp4】每5秒抽1帧保存为PNG # 用于场景变化检测 把【video.mp4】每秒抽5帧保存为JPG,宽度1920 把【video.mp4】每秒抽1帧,质量100%无损PNG # 用于AI超分处理 把【video.mp4】每半秒抽1帧 # 用于精细逐帧分析
拼接 —— 多文件合并 + 转场
把【clip1.mp4】和【clip2.mp4】拼接成一个视频 【list.txt】里列出的所有视频按顺序拼接 把【clip1.mp4】【clip2.mp4】【clip3.mp4】拼接,加淡入淡出转场0.5秒 把多段视频拼接并转成H.265编码
字幕 —— 硬字幕烙印 / 软字幕流
给【video.mp4】加上【sub.srt】硬字幕烙印 给【video.mp4】加上【sub.srt】软字幕流,播放器可选开关 给【video.mp4】底部添加白色硬字幕,字体大小24,位置偏下 给【video.mp4】添加SRT字幕,字体颜色白色字号20,位于画面顶部
画面缩放 —— 改分辨率 / 比例裁剪
把【video.mp4】缩放成1080x1920竖屏 # 9:16 手机 把【video.mp4】缩放成1920x1080横屏 # 16:9 电脑 把【video.mp4】缩放成1080x1080正方形自动居中裁剪 把【video.mp4】缩放成800x800正方形填充黑边 横屏视频【video.mp4】转成竖屏1080x1920,自动居中裁剪关键画面
变速 —— 加速 / 慢放 + 音调修正
把【video.mp4】1.5倍速播放 把【video.mp4】2倍速播放修正音调不变尖 把【video.mp4】0.5倍慢放,保留音频同步 把【video.mp4】3倍速快放做延时摄影效果 把【video.mp4】0.25倍慢放做子弹时间效果
叠加 —— Logo / 水印 / 角标
在【video.mp4】右上角叠加logo.png 在【video.mp4】左上角叠加透明水印透明度0.5 在【video.mp4】右下角加角标,大小120x40像素 在【video.mp4】中心叠加水印,尺寸200x200,透明度0.3
滤镜 —— 模糊 / 锐化 / 黑白 / 去噪 / 调色
把【video.mp4】画面上坐标(100,200)处模糊一个200x150的区域 # 隐私遮挡 把【video.mp4】整体做锐化处理 把【video.mp4】转成黑白影片风格 把【video.mp4】做视频去噪处理 把【video.mp4】调整色彩平衡增强对比度
音频处理 —— 音量 / 降噪 / 均衡器
把【audio.wav】音量提升1.5倍 把【audio.wav】音量降为原来的一半(0.5倍) 把【audio.wav】做自适应降噪去除底噪 把【audio.wav】调均衡低音+3,高音+2
音视频合并 —— 替换 / 混音
把【video.mp4】的音频替换成【new_audio.mp3】 把【video.mp4】的音频替换成【new_audio.mp3】,音频偏移0.5秒对齐 把【video.mp4】混入背景音乐【bgm.mp3】,保留原声
截图 / GIF / 元信息
从【video.mp4】第1分30秒处截一张图 从【video.mp4】自动每隔30秒截一张图作为预览缩略图 把【video.mp4】第10秒到第13秒转成GIF动图 把【video.mp4】第5秒开始的5秒转成480宽的GIF,每秒10帧 查看【video.mp4】的详细编码信息
静音 & 分段切分
把【video.mp4】第5秒到第10秒静音 把【video.mp4】第0分10秒到0分20秒和第1分0秒到1分15秒两段静音 场景检测算法把【video.mp4】自动切成多个镜头 用场景检测把【video.mp4】切分,灵敏度0.3,最小2秒一段 把【video.mp4】固定切成每60秒一段
一键复制到 Codex / WorkBuddy / Hermes / OpenClaw / Claude Code / Trae

复制下面整个方块粘贴到任意 Agent 的对话中,LLM 即可精确调用你的本地 AI 服务。无需一一配置,全量复制即可。

# 本地 AI 服务可用的函数列表

# 所有服务运行在 http://127.0.0.1:9003,认证方式:HTTP Basic Auth (admin / 你在客户端设置的密码)

# 24 个 AI 模型全部本地运行,不依赖任何云服务。另有 ffmpeg 可直接在命令行调用处理音视频。



[语音识别]



POST /plugin/whisper/infer

  参数: audio(文件), model(tiny/base/small/medium/large-v2/large-v3), language(zh/en/ja/ko/auto), output_format(txt/srt/vtt/json)

  返回: 文字内容

  用途: 语音转文字,支持 6 种模型尺寸和 4 种输出格式



POST /plugin/whisper/batch

  参数: folder(目录路径), model, language, output_format

  返回: 批量识别结果

  用途: 遍历目录所有音频批量转文字



POST /plugin/funasr/infer

  参数: audio(文件), vad(true/false), punctuate(true/false), hotwords("逗号分隔的热词")

  返回: 中文文字,带时间戳

  用途: 中文专精识别,支持 VAD 静音分段、标点恢复、热词增强



POST /plugin/funasr/speaker_diarize

  参数: audio(文件), speakers(说话人数量)

  返回: 带说话人标签的时间轴文字

  用途: 区分不同发言人,用于会议/访谈记录



POST /plugin/audio_align/infer

  参数: audio(文件), text(文件或字符串), language(zh/en)

  返回: 每个词的起止时间戳

  用途: 音频与文本词级对齐,用于口型同步、字幕精确匹配



[视觉识别]



POST /plugin/florence2/infer

  参数: image(文件), task(caption|detailed_caption|more_detailed_caption|object_detection|dense_region_caption|region_proposal|ocr|ocr_with_region|segmentation|phrase_grounding|caption_to_phrase_grounding|open_vocabulary_detection|region_to_category|region_to_description)

  返回: 根据任务不同返回描述/坐标/分类

  用途: 14 种视觉任务:描述图片、检测物体、OCR 提取文字、语义分割、区域定位等



POST /plugin/florence2/batch

  参数: folder(目录), task, output(可选输出JSON路径)

  返回: 批量结果

  用途: 对目录内所有图片执行同一视觉任务



POST /plugin/nsfw/infer

  参数: image(文件)

  返回: {drawings, hentai, neutral, porn, sexy} 各类置信度百分比

  用途: 图片内容审核,5 分类



POST /plugin/nsfw/batch

  参数: folder(目录), threshold(阈值0-1,默认0.7), move_flagged(true/false)

  返回: 审核报告JSON

  用途: 批量扫描文件夹,自动隔离违规文件



[图像处理]



POST /plugin/realesrgan/infer

  参数: image(文件), model(realesr-general-x4v3|RealESRGAN_x4plus|RealESRGAN_x4plus_anime_6B), outscale(2|4)

  返回: 超分辨率后的图片

  用途: AI 超分辨率,3 种模型:通用、写实(真人照片)、动漫



POST /plugin/realesrgan/batch

  参数: folder(目录), model, outscale, from_video(true/false)

  返回: 批量超分结果

  用途: 批量超分,from_video=true 时处理帧序列



POST /plugin/rembg/infer

  参数: image(文件), alpha_matting(true/false), bg_color(Hex 颜色如 #FFFFFF,空=透明)

  返回: 去背景后的PNG

  用途: AI 背景移除,输出透明或纯色背景



POST /plugin/rembg/batch

  参数: folder(目录), bg_color, format(png)

  返回: 批量去背景结果



POST /plugin/watermark/infer

  参数: video(文件), remove_type(subtitle|watermark|logo|all), mask_area(top|bottom|left|right|center), output_format(mp4|avi)

  返回: 去水印后的视频

  用途: AI 去水印/去字幕/去台标



POST /plugin/watermark/detect

  参数: video(文件)

  返回: 水印位置和类型信息

  用途: 检测视频中水印位置



[换脸]



POST /plugin/reactor/infer

  参数: source(源人脸图片), target(目标图片), face_index(多人脸时选第几张,0开始), upscale(true/false)

  返回: 换脸后的图片

  用途: 图片换脸



POST /plugin/reactor/video_swap

  参数: source(源人脸), target(目标视频), face_index, gpu_threads(并行线程数)

  返回: 换脸后的视频

  用途: 逐帧视频换脸



POST /plugin/reactor/detect_faces

  参数: image(文件)

  返回: 每张人脸的 bbox 坐标和置信度

  用途: 检测图片中人脸位置



[视频分析]



POST /plugin/vdf/compare

  参数: video1(文件), video2(文件), threshold(相似度阈值 0-1), sample_rate(每秒采样帧数)

  返回: 相似度分数

  用途: 检测两个视频是否相同(含裁剪/变速/画中画)



POST /plugin/vdf/find_in_library

  参数: query(查询视频), library(素材库目录), threshold

  返回: 匹配到的视频列表

  用途: 在素材库中搜索相似视频



POST /plugin/vdf/batch_dedup

  参数: folder(目录), threshold, action(report|move|delete)

  返回: 重复文件清单

  用途: 目录内批量去重



[语音合成]



POST /plugin/moss_tts/infer

  参数: text(文本或@文件路径), speed(0.5~2.0), sample_rate(16000|24000|48000)

  返回: 合成音频

  用途: 语音合成,48kHz 高音质



POST /plugin/qwen3_tts/infer

  参数: text, mode(instruction|clone|zero_shot), reference_audio(克隆模式必需), emotion(neutral|happy|sad|angry)

  返回: 合成音频

  用途: 3 种模式:指令式描述音色 / 声音克隆 / 零样本。支持情感控制



POST /plugin/dots_tts/infer

  参数: text(或@文件路径), voice(预设音色名), speed(语速)

  返回: 合成音频

  用途: 连续自回归合成,适合长文本



GET  /plugin/dots_tts/voices

  返回: 可用音色列表

  用途: 查询 dots.tts 有哪些音色



POST /plugin/gpt_sovits/infer

  参数: text, reference_audio(3~10秒参考音频), reference_text(可选,参考音频对白), language(zh|en)

  返回: 克隆后的语音

  用途: 全自动语音克隆+合成



[文生图]



POST /plugin/zimage/infer

  参数: prompt(正提示词), negative_prompt(负提示词,可选), width(512|768|1024), height, steps(推理步数 10~50)

  返回: 生成的图片

  用途: 文生图,6B 参数模型



[新增 AI 模型]

POST /plugin/yolo/infer
  参数: image(文件), task(detect|classify|segment|pose|obb), conf(0.1-0.75)
  返回: 检测结果含类别名、置信度、坐标
  用途: YOLO26n 物体检测/分类/分割/姿态估计

POST /plugin/wd14/infer
  参数: image(文件), model(wd-convnext-tagger-v3等11种), threshold(0.1-0.85)
  返回: rating/general/character 标签及置信度
  用途: AI 图片自动打标签

POST /plugin/easyocr/infer
  参数: image(文件), lang(en|ch_sim|ja等21种), detail(0纯文本|1含坐标)
  返回: 识别文字
  用途: 多语言 OCR 文字识别

POST /plugin/rife/infer
  参数: video(文件), factor(2|3|4), source_fps(原始帧率)
  返回: {output_path, output_size}, 通过 GET /plugin/rife/download?file=xxx 获取视频
  用途: 视频帧插值,提升帧率

POST /plugin/smolvlm2/infer
  参数: image(文件), question(文字问题)
  返回: 自然语言回答
  用途: 视觉问答,分析图片内容

POST /plugin/novasr/infer
  参数: audio(文件), model_ver(v1|v2|original)
  返回: {output_path}, 通过 GET /plugin/novasr/download?file=xxx 获取音频
  用途: 音频超分辨率 16kHz→48kHz

[工具类]


GET  /plugin/{name}/health

  返回: ok / error

  用途: 检查指定插件是否正常运行



GET  /ffmpeg/probe?file=路径

  返回: 编码/分辨率/时长/帧率/码率/音轨等完整元信息



POST /ffmpeg/{action}

  可用 action: transcode / trim / extract_audio / extract_frames / concat / add_subtitle / scale / speed / overlay / filter / audio_process / merge_audio_video / screenshot / gif / mute / split

  ffmpeg 不是插件,是系统级工具。LLM 已掌握 ffmpeg 的全部用法,这里仅列出可用端点。



[调用示例]

curl -u admin:你的密码 http://127.0.0.1:9003/plugin/whisper/infer -F audio=@speech.wav -F model=large-v3 -F language=zh -F output_format=srt

curl -u admin:你的密码 http://127.0.0.1:9003/plugin/nsfw/infer -F image=@photo.jpg

curl -u admin:你的密码 http://127.0.0.1:9003/plugin/realesrgan/infer -F image=@small.jpg -F model=realesr-general-x4v3 -F outscale=4

curl -u admin:yourpass http://127.0.0.1:9003/plugin/qwen3_tts/infer -F text="你好" -F mode=clone -F reference_audio=@voice.wav -F emotion=happy

curl -u admin:yourpass http://127.0.0.1:9003/ffmpeg/probe?file=C:/video.mp4

curl -u admin:pass http://127.0.0.1:9003/plugin/yolo/infer -F image=@photo.jpg -F task=detect

curl -u admin:pass http://127.0.0.1:9003/plugin/wd14/infer -F image=@photo.jpg -F model=wd-convnext-tagger-v3

curl -u admin:pass http://127.0.0.1:9003/plugin/easyocr/infer -F image=@scan.jpg -F lang=ch_sim

curl -u admin:pass http://127.0.0.1:9003/plugin/rife/infer -F video=@clip.mp4 -F factor=2

curl -u admin:pass http://127.0.0.1:9003/plugin/smolvlm2/infer -F image=@photo.jpg -F "question=What is this?"

curl -u admin:pass http://127.0.0.1:9003/plugin/novasr/infer -F audio=@speech.wav -F model_ver=v2
一句话生成 GUI 工具

下面每个工具都是用 一句中文 自动生成的独立可执行程序(~47MB),包含完整暗色中文界面。Token 成本仅 ¥0.05–0.30。生成后永久免费使用。

🎤 语音转文字

把文件夹录音批量转中文文字

¥0.05 · 1轮 · 47MB

🔍 图片超分辨率

文件夹图片批量AI放大4倍

¥0.08 · 1轮 · 47MB

🔞 图片内容审核

文件夹图片NSFW检测自动隔离

¥0.12 · 1轮 · 47MB

👁 图像描述

Florence-2批量详细描述图片

¥0.08 · 1轮 · 47MB

🎬 视频相似度比对

对比两视频是否同源

¥0.10 · 1轮 · 47MB

🎵 音频格式转换

批量提取视频音频为MP3

¥0.05 · 1轮 · 47MB

📸 视频帧提取

每秒抽1帧保存JPG

¥0.05 · 1轮 · 47MB

🖼 视频转GIF

视频片段转动图

¥0.05 · 1轮 · 47MB

📋 视频信息查看

查看编码分辨率帧率码率

¥0.05 · 1轮 · 47MB

✂ 视频截取

截取指定时间段片段

¥0.05 · 1轮 · 47MB

🔄 视频转码

H265编码自定义分辨率

¥0.05 · 1轮 · 47MB

💧 视频水印

添加文字水印

¥0.05 · 1轮 · 47MB

📱 视频竖屏裁剪

横屏转竖屏居中裁剪

¥0.05 · 1轮 · 47MB

🔊 音量调节

音频音量提升降低

¥0.05 · 1轮 · 47MB

🔗 视频拼接

多视频按序拼接

¥0.05 · 1轮 · 47MB

🎨 视频马赛克

画面区域打马赛克

¥0.05 · 1轮 · 47MB

🌅 视频淡入淡出

淡入淡出效果

¥0.05 · 1轮 · 47MB

🎞 黑白影片转换

转黑白影片风格

¥0.05 · 1轮 · 47MB

🪞 视频镜像

画面左右镜像翻转

¥0.05 · 1轮 · 47MB

📷 视频截图

指定时间截高清图

¥0.05 · 1轮 · 47MB

🖼 画中画合成

两视频并排合成

¥0.05 · 1轮 · 47MB

完全免费 · 开始使用

客户端免费、AI模型免费、内置LLM免费、生成软件免费、永久更新免费

迅雷云盘下载 百度网盘下载 夸克网盘下载

迅雷云盘提取码: pq3v  |  百度网盘提取码: gwmc  |  夸克网盘: 直接访问

请安装到纯英文路径 · 支持自动检查更新