这是给谁的
任何发布视频、又不愿失去那一半关掉声音观看的观众的人。需要在开放式办公室里跟着看的培训材料。发给那些读比听更顺畅的人的录播礼拜。任何必须满足无障碍要求的内容。
怎么运作
- 1
你上传视频或音频。我们提取声音,并找出哪里有讲话。
- 2
它被转写,如果你要了其他语言,也会被翻译。
- 3
文本在句子结束的地方被切成字幕,而不是在字符数用完的地方。
- 4
你按语言下载 SRT 和 VTT,直接拖进播放器就能用。
你得到什么
- SRT 和 VTT,任何播放器都接受的两种格式。
- 每种语言一个文件,全部来自同一段录音。
- 每行最多 42 个字符、绝不超过两行:手机上放得下又不挡住画面。
- 屏幕上停留不少于一秒、不多于七秒:不会闪,也不会像视频卡住。
- 在句末切分,所以没有字幕从半个词开始。
- 谁在说话——当声音不止一个而你要了这项时。
值得知道: 字幕来自录音,因为它们需要时间码——翻译好的文档没有可以挂时间的钟。在同一段发言内部,时间是按长度分配的,而不是逐词测量:足够跟着音频读,不足以对上口型。
问题
- 可以同时要多种语言吗?
- 可以,十五种同时来,出自同一段声音。每种语言都一样贵,说话每分钟 2 个积分,而且全都要数:正在说的那种也算。
- 字幕里会写是谁在说吗?
- 可以,当声音不止一个时:标签放在每段发言的第一条字幕上,而不是每一行都放,那会让屏幕塞满你已经知道的东西。
- 之后可以自己改吗?
- 它们就是普通的 SRT 和 VTT 文件。任何字幕编辑器都能打开,文本编辑器也可以。
- 长视频会不会越走越偏?
- 不会。每段发言都带着从音频里取出的起止时间,所以一个小时之后它们仍在词的位置上。
- 你们能把字幕烧进视频吗?
- 我们不做——我们把文件给你。ffmpeg 一条命令就能烧进去,而分开保存意味着观众可以关掉它。
对一个文件还能做的事
同一个文件、同一个引擎、同一个积分钱包。几乎没人只需要其中一项:转写完一场会议,最后总会想知道是谁在说。
只有你们那里才用的词
一个机构自己的名字——人名、街名、编号、职务——正是通用模型从没听过的东西,也正是它出错的地方:它会换成一个听起来差不多的普通词。写一次,就不再出错。 写在任务里,对那段录音生效。
- 这是一份清单,不是训练:写下来,从第一句话就生效。
- 它什么都不收集。不收你的音频,不收你的文本,一秒都不收。
- 而且是包含在内的。不是额外的套餐,也不是账单上的一行。