视频生成模型 · 训练 Infra 工程师
Embedding VC · San Francisco, CA · 1 mo ago
RemoteRemoteArt & CreativeFull-time
About the role
我们正在训练自研视频生成基础模型(DiT / Flow Matching),需要一位既能搭建训练平台,又能将研究代码部署到数百卡集群并确保稳定结果的工程师。
Responsibilities
- 训练平台搭建:从作业调度、断点续训、监控告警到数据/权重流水线,把分散的脚本沉淀为团队可复用的训练基础设施。
- 数百卡规模的分布式训练:FSDP、张量并行、Context Parallel、Ulysses,把MFU推到合理水位。
- PB级视频数据pipeline:NVDEC解码、VAE latent缓存、变分辨率bucket sampling。
- 显存与性能:FlashAttention、FP8混合精度、Triton kernel、activation checkpoint策略。
- 训练稳定性:loss spike根因分析、断点秒级恢复、慢节点自动剔除。
Requirements
- 精通PyTorch distributed与CUDA体系结构。
- 至少一个主流训练框架(Megatron/DeepSpeed/FSDP/TorchTitan)的源码级理解。
- ≥256卡训练实战经验。
- 有从零或半程搭建训练平台/集群调度/训练工具链的经验。
Qualifications
- DiT/Diffusion/视频数据处理经验。
- 写过Triton/CUTLASS kernel。
- 对HunnyuanVideo/Wan/CogVideoX等开源项目有源码级了解。
Benefits
提供真实数百卡算力、把训练当工程问题的团队、合规边界内的开源/发表空间。
Pay
TBD
Schedule
TBD