Black Forest Labs

一家位于弗赖堡的生成式AI研究实验室,专门开发FLUX图像和视频模型系列。2024年由Stable Diffusion背后的研究人员(Robin Rombach、Andreas Blattmann、Patrick Esser)创办。该公司向Adobe、Canva和Meta等公司授权这些模型,工程工作规模确实很大——包括多周GPU训练运行、Kubernetes和SLURM集群、值班轮换制。

关于这家公司

blackforestlabs · 弗莱堡, 德国 · 2026 年 6 月 23 日发布 61 天

已经开放 61 天了。这类岗位通常在头两周就筛完人,现在投是逆风。

Member of Technical Staff - Research Infrastructure Engineer

这份工作

维护和扩展研究基础设施,包括集群、监控和性能优化,并参与轮班待命。

  • Kubernetes
  • Python
  • Go
  • Nvidia GPU drivers
  • Prometheus
  • SLURM
办公未说明
年限未说明
学历未说明
语言未说明

为什么是你

  • Your current work at GMI Cloud — building an LLM proxy/gateway, tuning vLLM and SGLang, using OTel and dynamic routing — is almost exactly the 'research infrastructure' this team needs. You'd be scaling GPU clusters and optimizing inference systems, not starting from scratch.
  • Python is the first language listed, and your entire hands-on history is in Python. The observability and Kubernetes side maps directly to what you've built with OpenTelemetry, Nacos, and Redis.
  • This is a frontier AI lab where you could deepen your inference-serving expertise and stay in Germany. The role is infrastructure, not research, so your applied engineering background fits naturally.

我的顾虑

  • The role is in Freiburg, not Munich, and hybrid on-site is required (2 days/week or a monthly in-person week). That means moving, which you'd rather avoid. The salary range starts at 100k, making it financially plausible, but the disruption is real.
  • The posting emphasizes large-scale training platforms, while your LLM experience is on inference serving. The systems thinking transfers, but there may be a learning curve on the training side.
  • Black Forest Labs is a private company, not a listed corporation. Your residence depends on the employer's stability; this is a prominent lab with commercial traction, but still a research startup environment.

职位简介和要求

关于 Black Forest Labs

我们是 Latent Diffusion、Stable Diffusion 和 FLUX 背后的团队——这些基础技术改变了世界创作图像和视频的方式。我们正在打造生成式模型,为人们制作图像和视频提供动力——这些工具被全球数百万创作者、开发者和企业使用。我们的 FLUX 模型是世界上最先进的模型之一,而这一切才刚刚开始。

总部位于德国弗赖堡,并在旧金山不断扩展业务,我们在快速成长的同时,始终坚守使我们与众不同的特质:卓越的研究、开放的科学,以及构建拓展人类创造力的技术。

为什么选择这个职位

我们正在寻找工程师来构建和维护驱动我们视觉智能使命的引擎。从维护和扩展集群,到构建研究平台以加速创新速度,这个团队的工作兼具广度和深度。我们构建系统以实现数周/数月长的训练,大规模编排资源,同时保持高效,从而助力下一个突破性模型的诞生。如果你热衷于大规模分布式系统、基础设施可靠性、可扩展性、安全性以及持续改进,那么这个团队非常适合你。

你将负责的工作

• 维护研究基础设施,确保健康运行,并优化组件以从系统中获得最佳性能(包括应用和基础设施两方面)
• 扩展基础设施以满足不断增长的研究需求,同时保持可靠性和性能
• 与研究团队合作,深入了解他们的基础设施需求,设计平衡性能与成本效益的解决方案
• 通过对大规模分布式系统的深入分析,识别并解决性能瓶颈和容量热点
• 构建和演进遥测与监控系统,提供对云和数据中心集群基础设施性能、利用率和成本的深度可见性
• 参与轮值值班和事件响应,以维护系统可靠性

技术重点

• Python, Bash, Go
• Kubernetes
• Nvidia GPU 驱动和算子
• OTel, Prometheus

我们寻找的人才

• 具有构建或运营大规模训练平台的经验
• 曾使用大规模计算集群(GPU)
• 具有在大型分布式集群中调试性能和可靠性问题的能力
• 强大的解决问题能力,能够独立工作
• 良好的沟通能力,能够与内部和外部合作伙伴有效协作
• 对现代云基础设施有深入了解,包括 Kubernetes、基础设施即代码、AWS 和 GCP
• 具有 SLURM 经验
• 具有构建或运营大规模训练平台的经验

我们如何协作

我们是一个分布式的团队,拥有真正有人使用的实体办公室。根据你的职位,你将每周至少两天(或每两周全职一周)在弗赖堡或旧金山办公室工作,或者远程工作但每月有一周线下相聚以保持联系。我们将承担合理的差旅费用。我们相信面对面的时间很重要,并且已经为此安排了让所有人都能参与的方式。在面试过程中,我们会讨论该职位具体的工作安排。

我们所做的一切都基于四个价值观:

• 极致专注。我们是一个前沿研究实验室。科学必须正确,理解必须深刻,产品必须精美。
• 低自我。工作本身说话。最好的想法胜出,无论谁提出的。功劳共享。没有人凌驾于任何任务之上。
• 大胆。我们敢于下注雄心勃勃的目标。我们交付,不等待条件完美。
• 友善。人高于政治。我们以真诚的温暖对待彼此。没有同理心的能动性只会制造混乱。

如果这听起来像你感兴趣的工作,我们期待收到你的消息。

基本年薪:

欧盟 €100,000 - €230,000 + 股权
美国 $150,000 - $300,000 + 股权

该职位基于弗赖堡/旧金山办公室。我们采用混合办公模式,并承担合理的差旅费用——鼓励搬迁但非强制。我们期望有意义的线下参与,在面试过程中我们会讨论适合你情况的具体安排。