本地部署15个AI模型同时运行,智能调度GPU显存。全免费方案:AI模型开源免费、客户端免费、内置LLM免费、生成软件免费、无限复用免费。告别Coze拖40个节点 —— 几句中文完成从语音识别→翻译→换脸→去水印→超分辨率→字幕生成→视频合成的全自动流水线。API足够稳定清晰,智障模型也能零误差执行。
免费下载 Windows 版 VS Coze工作流对比同一任务,Coze需要手动搭建40+节点的工作流,龙虾只需要一句中文。
需要配置节点参数、字段映射、条件逻辑、错误处理...耗时数小时,还容易出错。
"检测【直播录像.mp4】中有无不适宜画面,自动切掉违规片段,把剩下的语音转成中英文双语字幕合成到视频里,输出1080p H.265成品。"
一行中文 → 自动编排10步流水线 → 无需任何配置
为什么龙虾能省90%+ Token?因为它的API不是模糊的自然语言桥接,而是精确、稳定、有类型的函数调用。
用自然语言描述调用whisper,每次都要写"请把音频转成文字,采样率16k,输出格式srt,中文识别..."
→ LLM每次都要揣摩你的意图
→ 参数容易传错或遗漏
→ 出错了要重新生成全量Token
→ 智能模型(GPT-4/Claude)才能勉强用
→ 智障模型根本玩不转
{"name": "whisper",
"params": {"audio": "<file>",
"model": "large-v3", "lang": "zh"},
"returns": "srt + txt"}
→ 模型只需选择函数名,不用描述过程
→ Schema保证参数类型,不会传错
→ 一次生成含10步流水线的脚本,仅耗3K Token
→ 智障模型也能零误差执行
算一笔账:
生成的短视频二创工具 = 一次消耗约¥0.3 Token
每天用100次,一年用3万次 = ¥0.3(因为软件已在本地,不再消耗Token)
如果每次都用云端AI处理 = 3万次 × ¥2/次 = ¥60,000
费用差 20 万倍。省下的钱够买一块 4090。
下面每个任务,在传统工具里需要编排几十个节点、写几百行代码。在龙虾里,就是一句话。
以下模型全部本地部署,通过统一API调用,支持智能GPU调度、模型热切换、批量并发处理
不仅是AI模型调用 —— 更是一个完整的本地AI工作站
用中文描述需求,自动拆解成10+步AI流水线。支持多模型联动、条件分支、失败重试。
GPU显存自动管理,LRU淘汰策略。模型按需加载/卸载,16GB显存同时运行6个模型不OOM。
把处理任务一键打包成带界面的独立.exe程序。非程序员也能发布自己的AI软件工具。
通过REST API接入Codex、WorkBuddy、Hermes、OpenClaw、Claude Code、Trae等AI编程助手。标准HTTP接口,任何语言都能调用。
整目录批量处理,多模型并发推理。万级文件自动分片并行,充分利用GPU资源。
所有AI模型运行在你的电脑上,数据不出本地。支持离线运行,无需网络。
通过标准REST API接入任何AI Agent或编程工具
# Codex / WorkBuddy / Hermes / Claude Code / Trae / OpenClaw 调用示例
curl -u admin:pass http://127.0.0.1:9003/plugin/whisper/infer -F audio=@speech.wav
curl -u admin:pass http://127.0.0.1:9003/plugin/nsfw/infer -F image=@photo.jpg
curl -u admin:pass http://127.0.0.1:9003/plugin/realesrgan/infer -F image=@small.jpg -F outscale=4
# 15个插件全部支持,统一认证,统一格式
掌握这些词汇后,任意组合即可描述复杂流水线。不用猜API支不支持 —— 下面出现的都能直接执行。配置选项都用粗体标注,方便识别。
复制下面整个方块粘贴到任意 Agent 的对话中,LLM 即可精确调用你的本地 AI 服务。无需一一配置,全量复制即可。
# 本地 AI 服务可用的函数列表
# 所有服务运行在 http://127.0.0.1:9003,认证方式:HTTP Basic Auth (admin / 你在客户端设置的密码)
# 15 个 AI 模型全部本地运行,不依赖任何云服务。另有 ffmpeg 可直接在命令行调用处理音视频。
[语音识别]
POST /plugin/whisper/infer
参数: audio(文件), model(tiny/base/small/medium/large-v2/large-v3), language(zh/en/ja/ko/auto), output_format(txt/srt/vtt/json)
返回: 文字内容
用途: 语音转文字,支持 6 种模型尺寸和 4 种输出格式
POST /plugin/whisper/batch
参数: folder(目录路径), model, language, output_format
返回: 批量识别结果
用途: 遍历目录所有音频批量转文字
POST /plugin/funasr/infer
参数: audio(文件), vad(true/false), punctuate(true/false), hotwords("逗号分隔的热词")
返回: 中文文字,带时间戳
用途: 中文专精识别,支持 VAD 静音分段、标点恢复、热词增强
POST /plugin/funasr/speaker_diarize
参数: audio(文件), speakers(说话人数量)
返回: 带说话人标签的时间轴文字
用途: 区分不同发言人,用于会议/访谈记录
POST /plugin/audio_align/infer
参数: audio(文件), text(文件或字符串), language(zh/en)
返回: 每个词的起止时间戳
用途: 音频与文本词级对齐,用于口型同步、字幕精确匹配
[视觉识别]
POST /plugin/florence2/infer
参数: image(文件), task(caption|detailed_caption|more_detailed_caption|object_detection|dense_region_caption|region_proposal|ocr|ocr_with_region|segmentation|phrase_grounding|caption_to_phrase_grounding|open_vocabulary_detection|region_to_category|region_to_description)
返回: 根据任务不同返回描述/坐标/分类
用途: 14 种视觉任务:描述图片、检测物体、OCR 提取文字、语义分割、区域定位等
POST /plugin/florence2/batch
参数: folder(目录), task, output(可选输出JSON路径)
返回: 批量结果
用途: 对目录内所有图片执行同一视觉任务
POST /plugin/nsfw/infer
参数: image(文件)
返回: {drawings, hentai, neutral, porn, sexy} 各类置信度百分比
用途: 图片内容审核,5 分类
POST /plugin/nsfw/batch
参数: folder(目录), threshold(阈值0-1,默认0.7), move_flagged(true/false)
返回: 审核报告JSON
用途: 批量扫描文件夹,自动隔离违规文件
[图像处理]
POST /plugin/realesrgan/infer
参数: image(文件), model(realesr-general-x4v3|RealESRGAN_x4plus|RealESRGAN_x4plus_anime_6B), outscale(2|4)
返回: 超分辨率后的图片
用途: AI 超分辨率,3 种模型:通用、写实(真人照片)、动漫
POST /plugin/realesrgan/batch
参数: folder(目录), model, outscale, from_video(true/false)
返回: 批量超分结果
用途: 批量超分,from_video=true 时处理帧序列
POST /plugin/rembg/infer
参数: image(文件), alpha_matting(true/false), bg_color(Hex 颜色如 #FFFFFF,空=透明)
返回: 去背景后的PNG
用途: AI 背景移除,输出透明或纯色背景
POST /plugin/rembg/batch
参数: folder(目录), bg_color, format(png)
返回: 批量去背景结果
POST /plugin/watermark/infer
参数: video(文件), remove_type(subtitle|watermark|logo|all), mask_area(top|bottom|left|right|center), output_format(mp4|avi)
返回: 去水印后的视频
用途: AI 去水印/去字幕/去台标
POST /plugin/watermark/detect
参数: video(文件)
返回: 水印位置和类型信息
用途: 检测视频中水印位置
[换脸]
POST /plugin/reactor/infer
参数: source(源人脸图片), target(目标图片), face_index(多人脸时选第几张,0开始), upscale(true/false)
返回: 换脸后的图片
用途: 图片换脸
POST /plugin/reactor/video_swap
参数: source(源人脸), target(目标视频), face_index, gpu_threads(并行线程数)
返回: 换脸后的视频
用途: 逐帧视频换脸
POST /plugin/reactor/detect_faces
参数: image(文件)
返回: 每张人脸的 bbox 坐标和置信度
用途: 检测图片中人脸位置
[视频分析]
POST /plugin/vdf/compare
参数: video1(文件), video2(文件), threshold(相似度阈值 0-1), sample_rate(每秒采样帧数)
返回: 相似度分数
用途: 检测两个视频是否相同(含裁剪/变速/画中画)
POST /plugin/vdf/find_in_library
参数: query(查询视频), library(素材库目录), threshold
返回: 匹配到的视频列表
用途: 在素材库中搜索相似视频
POST /plugin/vdf/batch_dedup
参数: folder(目录), threshold, action(report|move|delete)
返回: 重复文件清单
用途: 目录内批量去重
[语音合成]
POST /plugin/moss_tts/infer
参数: text(文本或@文件路径), speed(0.5~2.0), sample_rate(16000|24000|48000)
返回: 合成音频
用途: 语音合成,48kHz 高音质
POST /plugin/qwen3_tts/infer
参数: text, mode(instruction|clone|zero_shot), reference_audio(克隆模式必需), emotion(neutral|happy|sad|angry)
返回: 合成音频
用途: 3 种模式:指令式描述音色 / 声音克隆 / 零样本。支持情感控制
POST /plugin/dots_tts/infer
参数: text(或@文件路径), voice(预设音色名), speed(语速)
返回: 合成音频
用途: 连续自回归合成,适合长文本
GET /plugin/dots_tts/voices
返回: 可用音色列表
用途: 查询 dots.tts 有哪些音色
POST /plugin/gpt_sovits/infer
参数: text, reference_audio(3~10秒参考音频), reference_text(可选,参考音频对白), language(zh|en)
返回: 克隆后的语音
用途: 全自动语音克隆+合成
[文生图]
POST /plugin/zimage/infer
参数: prompt(正提示词), negative_prompt(负提示词,可选), width(512|768|1024), height, steps(推理步数 10~50)
返回: 生成的图片
用途: 文生图,6B 参数模型
[工具类]
GET /plugin/{name}/health
返回: ok / error
用途: 检查指定插件是否正常运行
GET /ffmpeg/probe?file=路径
返回: 编码/分辨率/时长/帧率/码率/音轨等完整元信息
POST /ffmpeg/{action}
可用 action: transcode / trim / extract_audio / extract_frames / concat / add_subtitle / scale / speed / overlay / filter / audio_process / merge_audio_video / screenshot / gif / mute / split
ffmpeg 不是插件,是系统级工具。LLM 已掌握 ffmpeg 的全部用法,这里仅列出可用端点。
[调用示例]
curl -u admin:你的密码 http://127.0.0.1:9003/plugin/whisper/infer -F audio=@speech.wav -F model=large-v3 -F language=zh -F output_format=srt
curl -u admin:你的密码 http://127.0.0.1:9003/plugin/nsfw/infer -F image=@photo.jpg
curl -u admin:你的密码 http://127.0.0.1:9003/plugin/realesrgan/infer -F image=@small.jpg -F model=realesr-general-x4v3 -F outscale=4
curl -u admin:yourpass http://127.0.0.1:9003/plugin/qwen3_tts/infer -F text="你好" -F mode=clone -F reference_audio=@voice.wav -F emotion=happy
curl -u admin:yourpass http://127.0.0.1:9003/ffmpeg/probe?file=C:/video.mp4
下面每个工具都是用 一句中文 自动生成的独立可执行程序(~47MB),包含完整暗色中文界面。Token 成本仅 ¥0.05–0.30。生成后永久免费使用。