跳到正文
← 全部指南

不上传视频,怎么找到某个人的那一秒

视频人脸检索的原理是抽帧、比对参照照、再把命中合并成时间区间。这篇讲清楚怎么定位某人出现在第几秒 —— 全程不离开你自己的电脑。

发布于 2026-09-24 约 5 分钟

在照片里找人是一个问题;在两小时视频里找到某人出现的那一秒是另一个问题 —— 也正是大多数人放弃、开始手动拖进度条的地方。

它之所以难,是因为视频不像文本那样可检索,没有东西可以 grep。可行的做法是视频剪辑师多年的老办法,只是自动化了:抽帧 → 在帧里找脸 → 把命中还原成时间点。

为什么云端视频检索在这里是笔坏交易

所有消费级「搜索你的视频」功能都是同一套:你上传视频,别人家的 GPU 处理,再把时间码返回给你。一段度假视频这么干很方便;但只要是采访素材、客户片子、家庭录像、或者画面里有未成年人 —— 这就不是方便不方便的问题了。

上传还很慢。几小时素材就是几十 GB,上传时间往往比分析时间还长。放在本地,这两个问题一起解决,这也是视频人脸检索该跑在自己机器上的原因。

视频人脸检索到底怎么做的

SnapByFace 把视频当成一串静态帧来处理:

  1. 每秒看一次。大约每秒看一次是最合适的点:密到能抓到走过镜头的人,又稀到不至于让长视频跑一整天。
  2. 检测并编码人脸,用的是和照片同一套自带模型。
  3. 把这些时刻与参照照逐一比对,留下足够接近的。
  4. 把连续命中合并成时间区间。连续二十帧命中会合成一条 —— 「02:14–02:34」—— 而不是二十条结果。

最后这一步才是决定好不好用的关键。一串帧号 technically 正确,但完全没法用;合并成区间才告诉你把播放头拖到哪儿。

:::note 视频支持 MP4、MOV、AVI、MKV、M4V、WebM、TS;图片支持 JPG、JPEG、PNG、BMP、TIFF、WebP、HEIC/HEIF。两者进的是同一个索引,所以一张参照照能同时找出照片和视频里的人。 :::

操作流程

  1. 添加这个人的参照照 —— 一张清晰的正脸。
  2. 添加存放视频的目录。SnapByFace 会递归扫描,所以积了好几年的乱目录也没关系。
  3. 开始建索引。它在后台跑,可以暂停、继续、取消;意外退出后会从中断处继续。
  4. 打开结果。每条视频命中都带时间区间 —— 双击直接跳到那一秒。

要跑多久?

工作量由视频的时长决定,而不是文件大小:一小时素材大约要看 3600 个时刻。

两件事让它在大素材库上仍然可行:

  • 增量重索引:新增素材不会把已索引的部分再分析一遍。
  • 什么规模都快:即使几十万张人脸,检索也能保持快速,结果就在你还看着屏幕的工夫里出来。

想先看看效果再决定要不要索引整个库,就先索引一个文件夹,拿排名靠前的命中跟自己的预期对一下。这是判断 0.45 适不适合你素材的最便宜的办法。

什么留在你的机器上

识别与检索都在本地完成。没有视频、没有画面,也没有任何关于人脸的信息被上传:软件了解的一切都放在 ~/.snapbyface/。SnapByFace 只读你的素材,从不写入 —— 不重命名、不移动、不重新编码。

唯一外发的是可选的设备统计 ping,内容是机器码、软件版本、操作系统、语言与激活状态 —— 不含文件名、不含素材、不含检索行为。默认开启,可在设置里关闭。

什么情况下结果会让你失望

开工之前值得知道:

  • 快速剪辑和严重动态模糊会出现人脸不够清晰的画面。一闪而过的出现也可能刚好落在两次查看之间。
  • 画面里脸很小(大场景的人群镜头)对任何人脸检索都是难题。
  • 外貌变化大,或者参照照和视频里的样子差太多,分数会掉到阈值以下 —— 试试再加一张参照照。

拿你自己的素材试一下

试用版跑完整的本地检索,每人显示 5 条、每次搜索 20 条命中 —— 足够判断它在你的素材里到底找不找得到。试用期间累计最多发起 100 次分析。

拿你自己的素材库试一下

免费试用就能跑完整的本地检索 —— 不需要账号,不需要上传。