虽然 Gemini 可能已经不是部分使用者的首选模型,不过 Gemini 的“影片理解”
能力我认为是它与竞品不同的地方。
如果有人想研究 AI 剪辑,但没有什么头绪的话,分享一些我近期结合了云
端 Gemini 与地端模型的实验与想法。
【影像】
最近有时间就会研究怎么让 AI 辅助剪片,而 Gemini 的影片与图片解读能力
确实帮了我很多。
例如,手上有一整批拍摄毛片时,可以先用 FFmpeg 将影片转成比较轻量的
proxy,再让 Gemini 看完并整理成简单的 Clip Card,记录每支素材拍到
了什么以及可能适合放在影片的哪个段落等资讯。这些 Clip Card 做好后就
可以保存在本机。
之后想把同一批素材剪成不同主题或长度的影片时,不需要再让 Gemini 重
看全部毛片,只要先从 Clip Card 找出可能适合的片段,再回到原始影片确
认画面即可。
如果只是一般接片,找到素材后其实就可以开始剪了。但如果想将横式毛片
重新构图成 9:16,或是让画面持续跟着人物、手机与产品移动,就还需要知
道物件在每个影格中的位置。
这时就利用 Gemini 的“图片理解”与“物件侦测”能力,找出指定物件的
定界框。根据 Gemini 回传的座标换算为影片内的实际位置。不过图片是静
态的,Gemini 找到的座标只能代表单一时点,所以接着又用了 SAM 2.1 来
协助追踪物件的移动。
【音讯】
受 Palmier Pro 用 Apple SpeechTranscriber 做字幕的启发,我实验了一套
让“字幕准确度”跟“细粒度时间轴”可以尽量兼得的转录方式。
Apple SpeechTranscriber 语音辨识的强项是时间,每个字都有自己的起讫
时间码,但是中文辨识不够准确,会掉字或者同音错字。
所以我的做法是找了 Gemini 的“影片理解”能力来补强,让 Gemini 独立
看一次影片,并回复逐字稿,接着再修正回去 Apple SpeechTranscriber 的
时间去。
然后也让 Gemini 回复时一并输出判断符号,让程式判断这个是要用来断行
、术语还是要剪掉的赘词。
GOOGLE的影片图片理解是他的强项没错,很强我之前上传监视器影片,问他某个人物出现多少次都能算得出来
作者:
tim1112 (絕代當世åŠå·”)
2026-07-23 12:06:00可是我昨天让Ginimi分析一场布袋戏的武戏,感觉结果满空泛的,而且有一种偷偷从别的管道查资料的嫌疑而且还查错。
如果是在 Web / App 上分析 YouTube 影片时务必要看到有跳出 YouTube icon,不然 Web / App很容易呼叫工具失败
“可能不是不” 你讲话可能不要不这么多赘字,看了实在不是不难理解