利用智谱 AI 免费的 glm-4v-flash 模型，制作了个视频硬字幕提取软件

By: jianchang512

20 December 2024 at 18:19

jianchang512: 智谱 AI 的 glm-4v-flash 模型不仅免费（仅限制调用频率，不限制次数），而且具备图像理解能力，可以作为 OCR 工具使用。虽然目前仅支持中英文识别，但对于大多数场景已经足够。

基于此开发了一个硬字幕提取软件。

## 技术原理

1. 视频切帧：首先，使用 FFmpeg 工具将视频按 1 秒间隔切分为图像帧。按照上中下三等分根据选择取其一。选择 1 秒间隔而非逐帧提取

2. OCR 识别：将切分后的图像帧发送给智谱 AI 的 GLM-4V-FLASH 模型，进行 OCR 识别，提取图像中的文字。

3. 字幕去重：由于连续的图像帧可能包含相同的字幕内容，为了避免重复，使用 sentence-transformers 模型计算当前识别出的字幕与前一句字幕的相似度。如果相似度超过 60%，则认为两条字幕内容相同，进行去重。

4. 生成字幕文件：最后，将去重后的字幕文本按照对应的时间戳进行拼接，并保存为 SRT 格式的字幕文件。

软件下载地址 https://github.com/jianchang512/stt/releases/download/0.0/GVS-0.1.7z