研究工作展示

每项工作一个目录:实验记录、对比视频和交互页面。

Beyond Time Shifts ECCV 2026

paper.qianyijie.com/beyondtimeshifts/

画面很真,声音却穿帮:开源的音视频「因果裁判」,检查生成视频里声音和画面的因果是否对得上,并给出主流视频生成模型的排行榜。

AnchorTalk 需要口令

paper.qianyijie.com/anchortalk/

以首帧为锚的长时说话人音视频生成:把 MiniMax-H3 的 Ref2VA 改成按块因果的流式学生,再用 Self Forcing++ 式的分段 DMD 在自身长历史上训练,让一分钟级的视频在身份、颜色、清晰度和口型上不漂。页面是 12 段留出长视频的评测对比,随训练自动更新。

AssetWorld

paper.qianyijie.com/assetworld/

资产锚定的生成式世界:把视频里的物体抬升成 3D 资产或 Blender 场景,作为证据注入世界模型(SolarWM-H3 等),让回访时物体保得住,并能编辑和控制。全部 training-free。