论文阅读笔记 | From Priors to Perception: Grounding Video-LLMs in Physical Reality
一、Motivation模型不是看不见而是不肯看Video-LLM 在通用视频理解上已经很强但在细粒度物理推理上系统性失效悬浮、刚体穿透这类明显违反物理的现象都识别不出来。以往的解释是模型只学到了视觉-文本相关性本文进一步追问这到底是感知不行还是推理被劫持作者用一个小球撞多米诺的场景做了拆解发现两类失败是成对出现的反物理Anti-Physics场景小球没接触多米诺但骨牌倒了。GPT-4o 不但没识别异常反而编造初始动能传递来强行自洽→ 这是逻辑先验“世界必须符合常识”压倒了视觉证据称为强行合理化Forced Rationalization。反直觉Counter-Intuitive场景小球擦过多米诺、根本没碰上物理上完全合法。模型无视那道明显的空隙直接输出金属球精准击中第一块骨牌触发经典多米诺效应 → 这是统计先验“球多米诺 碰撞”压倒视觉证据称为刻板输出Stereotypical Output即what-it-expects-is-what-it-sees。两个 pilot study 排除了知识/感知缺陷这两个替代解释不是知识不够给 VideoLLaMA3 注入物理知识 QA 做 SFT 后反物理场景的错误更严重了知识反而成了编故事的素材。不是感知不行单帧输入下问球和骨牌的空间关系模型能准确回答两者未接触中间有明显空隙。于是作者提出Unified Attribution Theory统一归因理论两类失败是同一个病因的两种表现形式 ——Semantic Prior Dominance语义先验支配。视觉编码器是好的坏的是推理链路它被内部的叙事脚本劫持用主观预期覆写了客观视觉证据。二、Related Work三条已有路线各自的坑2.1 Video-LLM 的物理推理交互密集的 benchmarkPhysBench、MotionBench放大了刚体动力学、空间接触上的缺陷。已有文献多把这种视觉忽视归入多模态幻觉VideoHallucer、EventHallusion、Argus、NOAH。作者的批评是把它当成故事续写缺陷会错失物理缺陷的本质—— 评估物理推理要从宏观时序连贯性下移到即时的、低层的空间感知。2.2 缓解手段的三种范式及其局限范式代表局限架构改造TRAVL、PhyVLLM、trajectory attention引入 tracker / Neural ODE计算开销大跨场景跨底座泛化极差推理期干预SEASON对比解码、GAVIE只改 logits是表面补丁没动内部权重里的先验RL 对齐DPO/GRPO 系VideoHallu、Video-R1、VideoChat-R1高维多模态空间收敛不稳定本文选的是第四条路架构无关 轻量VARC 标准 LoRA。2.3 物理感知视频数据集Impossible Videos、TRAVL、WorldModelBench 等的负样本是从 T2V 模型SVD / Sora / Kling / Veo里被动捞取生成失败。问题致命把生成伪影纹理闪烁、物体融化和真正的物理谬误混在一起模型学到的是伪影检测器这个 shortcut而不是物理推理。→ 这正是 PACC 要解决的合成视觉上干净、物理上非法的成对视频“Visually Plausible, Physically Invalid”。三、MethodPACC数据 VARC推理格式 成对梯度抑制训练3.1 PACC 数据集的分类体系2 流 × 8 维分类不是随便列 edge case而是对齐发展心理学的 Core Knowledge 理论Spelke、Baillargeon和经典直觉物理 benchmarkIntPhys、CLEVRER映射到三条基础原则时空连续性Temporal、物体凝聚/永恒性Permanence、机械接触Interaction。Stream 1: Anti-Physics打击强行合理化Temporal Fallacies时间线性与因果顺序①Coherence Violation微观时序连续性被破坏正常走路视频帧打乱 → 人随机传送②Causal Reversal宏观因果倒置花瓶先碎在地上之后才看到它掉落Permanence Fallacies质量守恒与形态稳定③Existence Violation物体凭空出现/消失小球被遮挡后消失小布下掀出巨物④Identity Violation内在属性无外因突变狗无缝变成羊一个弹球分裂成多个Interaction Fallacies因果一致性⑤Dynamic Violation牛顿定律 / 力平衡 / 熵箭头玩具鸭无外力自己动抛物线消失走直线跷跷板重端悬空碎片自发重组⑥Constraint Violation因果量级失配 / 环境约束 / 刚体失效水下燃烧小石头掀巨浪机械臂穿墙强光下瓷杯没有影子Stream 2: Counter-Intuitive打击刻板输出—— 注意这一流物理上是完全合法的是陷阱样本⑦Near-Miss轨迹进入交互区但存在清晰空隙接触没发生球擦过多米诺脚踢空⑧Consequence Arrest起始动作成立但预期后果被阻断锤子砸玻璃但玻璃完好杯子倾斜但水没洒出成对设计Positive / Negative pair是关键每条负样本都有对应的正常正样本。这提供了对比信号迫使模型定位具体的物理违背点同时防止模型塌缩成一律预测异常的 shortcut。3.2 PACC 构建流水线HITL 四阶段素材来自 SSv2、PhysBench、Panda-70M、ImplausiBench、ActivityNet、Physics-IQ 以及 Pexels。Stage 1 Selection Clipping人工筛选只含单一物理交互的高质量源视频LLM 辅助映射到目标分类维度并标注目标谬误场景裁掉冗余帧 → 得到原子级正样本。Stage 2 Visual Fact Anchoring用多模态 LLMGemini 3.1 Preview生成纯观察性 caption专家清洗(a) 去幻觉(b)严禁物理推测不许写因重力而下落→ 得到纯视觉事实锚点。Stage 3 Adversarial Generation Label Synthesis按是否需要合成新像素路由分流Deterministic Manipulation手工 CV 编辑只需重排已有像素/时序操作的帧打乱、mask 擦除用 SAM2 ProPainter。Generative SynthesisAI 生成需要新像素或改物理属性的形态突变、轨迹偏移用 Kling 等 prompt 驱动生成。同时由 LLM 合成配对的 CoT 标签Observation / Attribution / Verdict。Stage 4 Final Verification双重专家复核。Video Verification确保负样本是无歧义的物理谬误丢弃那些看起来只是生成失败的样本—— 这就是伪影解耦落地的地方Logic Verification审查标签归因逻辑的科学正确性。统计758 对高保真对抗视频1516 个独立 clip平均时长4.0 秒。分布Dynamic 27.1%、Constraint 19.0%、Near-Miss 14.1%、Coherence 11.1%、Causal Reversal 11.1%、Identity 6.1%、Consequence Arrest 6.1%、Existence 5.4%。3.3 VARCVisual-Anchored Reasoning Chain传统 Video-LLM 估计P(y∣V,Q)P(y|V,Q)P(y∣V,Q)在先验支配下退化为视觉无关的捷径P(y∣Q)P(y|Q)P(y∣Q)。VARC 把推理写成一条有向 Markov 链插入中间的视觉观察OOO与模型内置物理知识K\mathcal{K}KP(y∣V,Q)≈P(O∣V)⋅P(A∣O,K)⋅P(y∣O,A)P(y|V,Q) \approx P(O|V)\cdot P(A|O,\mathcal{K})\cdot P(y|O,A)P(y∣V,Q)≈P(O∣V)⋅P(A∣O,K)⋅P(y∣O,A)Step 1 Forced Observation∼P(O∣V)\sim P(O|V)∼P(O∣V)只允许描述低层空间关系与状态变化例如显式写出存在空隙禁止提前下判断。Step 2 Causal Attribution∼P(A∣O,K)\sim P(A|O,\mathcal{K})∼P(A∣O,K)在OOO条件下调用物理知识靠OOO与K\mathcal{K}K的逻辑冲突去检测谬误例如水下燃烧在热力学上不可能而不是编造隐藏变量去圆场。Step 3 Evidence-Based Verdict∼P(y∣O,A)\sim P(y|O,A)∼P(y∣O,A)最终判定被前两个节点严格约束。3.4 对抗课程与成对梯度抑制SFT 时把对齐的正负样本联合优化pair 间随机采样pair 内顺序绑定梯度累积步数设为 4保证一次反传里正负样本同时在。这样产生Gradient Suppression来自共享视觉语义背景、光照、静态外观的梯度被相互抵消优化自然绕过静态视觉分布收敛到核心物理差异上。由于 pilot study 已证明低层感知完好视觉编码器冻结LoRA 只加在视觉 projector LLM backbone精准打击推理瓶颈。得到的模型叫PhyARPhysics-Anchored Reasoner。四、Experiments4.1 设置底座VideoLLaMA3-7B训练集 604 对1208 视频3 epochLoRA (r16, α32, dropout0.1)lr 5e-5cosine8-bit AdamW4-bit NF4 量化 bf16 计算 FlashAttention-2。算力8 × RTX A6000全程 SFT 约 4 小时轻量确实是卖点。测试集154 对 / 308 视频。所有模型统一 16 帧、greedy decodingdo_sampleFalse,temperature0、max_new_tokens2048、统一 VARC prompt、baseline 零样本。指标PCAPair-wise Consistency Accuracy正负样本都对才算这一对正确 —— 直接掐死一律答 Real的 Yes-bias。RASReasoning Alignment Score1–5Gemini 2.5 Pro 做 LLM-as-a-Judge且强制 accuracy 与 score 对齐判定错 → 只能给 1–2判定对但推理是幻觉 → 3。RPBRelative Prior Bias借 Michelson 对比度RPBAccpos−AccnegAccposAccnegRPB \frac{Acc_{pos} - Acc_{neg}}{Acc_{pos} Acc_{neg}}RPBAccpos​Accneg​Accpos​−Accneg​​直接量化先验支配程度。4.2 主结果PCAAvg.PhyAR41.56% Gemini 2.5 Flash 40.91% GPT-4o 38.31% Qwen3.5-35B 13.64% VideoLLaMA3-7B7.79%底座Video-ChatGPT / Flash-VStream 仅 0.65%。几个值得注意的点反直觉流是碾压式提升Near-Miss 68.20GPT-4o 45.50 / Gemini 27.20、Consequence Arrest 70.00两家闭源都是 40.00。这一流恰恰是必须老实看画面的地方。反物理流里闭源模型仍有局部优势Dynamic Violation 上 Gemini 45.20 / GPT-4o 35.70 PhyAR 28.60Existence 上 GPT-4o 55.60 PhyAR 22.20。作者归因于闭源模型庞大的预训练世界知识。小开源模型是系统性塌缩默认全部预测物理合理所以负样本几乎全错PCA 被 pair 约束直接打到接近 0。RASAvg.Gemini 2.5 Flash 2.286 GPT-4o 2.120 PhyAR2.036 Qwen3.5-35B 1.477 其余开源基本贴在 1.0 下界VideoLLaMA3 1.237。但在反直觉两类上 PhyAR 超过所有 baselineN-Miss 2.523、C-Arrest 2.950。作者的结论很有意思生成能力会写漂亮的物理解释无法补偿反直觉场景下的事实性失明。4.3 消融方法PCA Avg.RAS Avg.Baseline SFT24.681.760w/o VARC28.571.802w/o Pair-wise29.221.763PhyAR (Full)41.562.036两个组件缺一个都掉 12 个点且存在明显的协同效应28.57 和 29.22 都远小于 41.56而 baseline SFT 是 24.68—— 说明格式约束和梯度层面的先验抑制打的是同一个病的两个面。4.4 先验偏置分析RPB指标VideoLLaMA3 (base)PhyARAccposAcc_{pos}Accpos​(%)93.179.9AccnegAcc_{neg}Accneg​(%)10.848.1Overall Acc (%) ↑51.964.0RPB (%) ↓79.124.9底座 93.1 / 10.8 的巨大落差就是先验支配的量化证据遇到熟悉的物理概念就默认点头。PhyAR 把 RPB 从 79.1 压到 24.9同时整体准确率从 51.9 提到 64.0。注意AccposAcc_{pos}Accpos​是下降的93.1 → 79.9—— 这是去 Yes-bias必然付出的代价好在净收益是正的。4.5 定性反物理液体持续注入但杯中液面不上升baseline 输出无可见异常RealPhyAR 观察到液面保持静止 → 归因违反质量守恒 → Forged。反直觉杯子掉落但完好无损baseline 直接编造出碎裂事件去迎合统计预期PhyAR 锚定杯子完好 → 归因合理的弹性碰撞 → Real。五、Conclusion Limitations提出Unified Attribution Theory把反物理下的强行合理化与反直觉下的刻板输出统一归因为Semantic Prior Dominance。构建PACC首个基于物理定律程序化合成、严格解耦生成伪影与物理谬误的成对对抗视频数据集。设计VARC强制观察 → 归因 → 判定机制性阻断先验劫持配合成对梯度抑制 标准 LoRA零架构改动取得显著提升。局限受严格 HITL 专家验证限制PACC 目前只有 758 对。作者主张这是有意的取舍—— 优先保真度与物理严谨性把它定位成 CLEVRER / IntPhys 式的精准诊断 benchmark未来探索自动化合成以扩规模。Broader Impact里也坦诚了 dual-use 风险合成高保真物理异常视频的管线可被用于 deepfake建议强制水印反过来 PACC 也能用于训练基于物理不一致性而非像素伪影的深度伪造检测器。