众力资讯网

一段动作,为什么要同时看深度和骨架?我把自有的视频深度/姿态工作流重做成了「动作

一段动作,为什么要同时看深度和骨架?

我把自有的视频深度/姿态工作流重做成了「动作显影」:一个不带模型权重、先查权利再动手的纯 Agent Skill。

Demo 展示的是同一动作概念的四类 AI 合成示意:动作源、相对深度、COCO-17 二维骨架、融合控制。它们不是现场模型推理,也不是像素级同帧派生;网页不接收文件、不联网、不上传。

完整工作流:① 确认素材权利与隐私② 只读审计用户提供的 adapter 和本机 ffmpeg/ffprobe③ 生成脱敏运行计划,Skill 本身不下载、不安装、不执行模型④ 宿主经用户另行授权后执行 adapter⑤ 只读核验固定文件、哈希、25fps/H.264、空白/重复输出与有限视觉信号⑥ 只在机器证据通过后给 READY_TO_TRY;版权、人审与发布仍单独放行

离线红队:16/16 PASS;空白四同、非空四同、错误帧率、外部协议引用均 fail-closed。权利/QC 只记为“已接收、未独立核验”,发布状态永远不由技术检查自动批准。

按 Codex、Claude Code、Gemini CLI、GitHub Copilot、腾讯 WorkBuddy、阿里云 Qoder CN(CLI / QoderWork CN)六类宿主的官方 Skill 文档设计;WorkBuddy 与 Qoder 均有原生 Skill 说明,但本项目只完成 Codex 与通用脚本/结构 smoke,其余五端未做实机认证。

原创软件以 PolyForm Noncommercial 1.0.0 免费供个人和非商业团队使用;原创文档与合成视觉采用 CC BY-NC-SA 4.0。第三方模型、运行时和用户素材不在授权内,也未随包分发。

GitHub:网页链接

截至 2026-08-13 的公开检索样本中,暂未发现与“视频转深度图+骨骼/姿态控制”直接同类的 VibeVision 作品。

微博VibeLabVibeVision