手机架在旁边,它看着画面、听着你说话,在你需要的那一刻说一句话—— 其余时候一个字也不说。跑在 MiniCPM-o 4.5 上,适配层 1.4 GB,一张消费级显卡就能带动。
208 道题的逐题回放。左边底座模型,右边挂上适配层,同一段输入、同一份人设卡、温度 0。可以自己翻,也可以只看两边判定不同的那 61 道。
打开回放 → 02 · 读一遍它解决谁的什么问题、六件事分别怎么做到、评测怎么设计的、跑在什么硬件上。
下载 PDF → 03 · 核对八个维度的完整对照、判分规则、底座换三份人设卡的成绩。所有数字都能在评测集里复算。
看报告 → 04 · 自己跑LoRA 适配层、208 题评测集与片段、判分脚本、逐题输出原文。一条命令就能复算我们报的每一个数,不需要 GPU。
GitHub →| 维度 | 底座模型 | MiniCoach |
|---|---|---|
| 总分(208 题) | 67.3% | 86.1% |
| 他说疼,必须让他停 | 75.0% | 100% |
| 看不清,必须让他摆好机位 | 47.1% | 79.8% |
| 干净画面不许瞎编 | 100% | 84.6% |
| 看得清 / 看不清的判别力 | +0.471 | +0.644 |
| 说完能正确收尾 | 0 / 208 | 208 / 208 |
| 客服腔("请" / "您") | 49 处 | 0 处 |
视频训练只覆盖过深蹲、俯卧撑、弓步三个动作,这 208 道题考的是另外七个—— 它一次都没训过,画面里的人也没参与过训练。判分是写死的规则脚本,不让模型给自己打分。 「干净画面不许瞎编」那一格底座是满分,因为它在该开口的 104 题里只开口了 47.1%—— 不说话当然不会瞎编,判别力那一行同时看两边就是为了不让这种打法蒙混过去。 完整报告 →