AI DATA · MODEL EVALUATION

我是张炜瑜An AI Trainer一年 AI 训练师经验

我从事多模态训练数据与模型评测。从规则设计、质量控制到 Badcase 归因,把模糊要求整理成清晰、可靠、可复用的评价标准。

20 万数据规模97.3% 交付准确率单位时间产能 +50%
查看我的项目
张炜瑜的卡通形象

Welcome to我的数据世界!

一年多模态数据与模型评测经验,参与视频生成、文生图及植物识别项目。 从试标、规则设计到质量控制和 Badcase 归因,我习惯把模糊的任务要求整理成清晰、可靠、可复用的评价标准。

我最擅长的,是把复杂流程拆成团队能执行的步骤。 当数据质量出现波动时,我会回到样本、规则和 Badcase 中定位原因;当口径不一致时,我会把判断边界写下来,让沟通和复核有据可依。

我也会用 Vibe Coding 与 Dify 做一些贴合实际流程的小工具。 无论是视频抽帧与 Caption 预标、图像预检,还是项目管理看板,我希望把重复劳动交给工具,把更多注意力留给真正需要判断的问题。

最近在做

项目不是履历里的装饰,
而是我理解世界的方式。

视频生成 · 训练数据01 / 03

快手可灵

多模态视频 Caption 训练数据建设

将主体、动作、场景、镜头与时序关系转成可训练 Caption,并推动规则、质检与 Badcase 的闭环迭代。

8 万条项目规模95.6% 交付准确率单位时间产能 +50%
01 / 03

多模态视频 Caption 训练数据建设

项目背景

项目面向视频生成模型的 Caption 训练数据建设,需要将视频中的主体、动作、场景、镜头语言与事件先后关系转化为结构清晰、语义准确的文字描述。

前期试标发现,主体遗漏、动作关系不清、镜头变化未体现、时序描述混乱等问题会直接影响数据一致性。因此,项目需要在交付过程中持续校准描述标准,并沉淀可执行的质检规则。

个人职责

参与项目试标、Caption 标注复核、质量检查与 Badcase 复盘,核对主体、动作、场景、镜头与时间顺序等信息是否完整、准确且前后一致。

在试标和质检过程中整理典型错误与边界案例,推动规则迭代;结合实际工作流程,使用 Vibe Coding 搭建视频抽帧与 Caption 预标工具,辅助人工处理与复核。

执行动作

1. 对视频内容进行拆解,核对主体、动作、场景、镜头变化和事件顺序,判断 Caption 是否存在信息缺失、描述错误或逻辑不清。

2. 在试标阶段归纳主体识别、动作关系、镜头语言和时序表达中的高频问题,整理判断方式及质检关注点。

3. 使用 Vibe Coding 搭建“视频抽帧+Caption 预标”工具,将部分重复性工作前置,并保留人工修订与质量复核。

4. 将低质量样本、争议案例和高频错误沉淀为 Badcase,结合复盘结果更新标注与质检规则。

项目成果

项目支持视频 Caption 训练数据 8 万条交付;参与相关批次的标注、质检与规则迭代,项目记录的交付准确率为 95.6%。

视频抽帧与 Caption 预标工具将单条处理时长由约 30 分钟降至 20 分钟;按相同工作时长计算,单位时间产能提升 50%,团队日均产出约 20 条/人。

项目过程中形成的规则、Badcase 与复盘机制,为后续批次的质量校准、问题定位和团队沟通提供了可复用依据。

04 / CONTACT

有想法?
一起把它做出来。