APPLY TO SPEEDRUN
← Twelve Labs
Twelve Labs · Hiring

Staff Machine Learning Engineer, Pegasus - TrainingOps

Seoul, South KoreaHybridFull Time

Who we are

영상은 전 세계 데이터의 90%를 차지하지만, 그 대부분은 아직 기계가 이해할 수 없는 영역에 머물러 있습니다.

트웰브랩스(TwelveLabs)는 이 문제를 해결하기 위해 기계가 영상을 이해할 수 있도록 하는 AI 인프라를 구축합니다. 사람보다 더 정교하고 깊이 있게 영상을 이해하는 AI 모델을 통해 영상 속 시·청각 정보를 종합 분석하여 미디어·엔터테인먼트, 스포츠, 보안, 공공 분야 전반의 워크플로우에 적용하고 있습니다.

NEA, Radical Ventures, Amazon, NVIDIA, Snowflake, Databricks, Index Ventures, 네이버벤처스, 한국투자파트너스, Quadrille Capital, Red Bull Ventures 등 글로벌 투자자들로부터 누적 3천억원 이상의 투자를 유치했습니다. 또한 Fei-Fei Li, Silvio Savarese, Alexandr Wang 등 세계적인 AI 리더들이 자문진으로 함께하고 있습니다.

트웰브랩스는 샌프란시스코, 서울, 뉴욕, 런던 네 개의 오피스를 거점으로 운영되는 글로벌 기업입니다. 핵심 연구개발은 서울에서 이루어지며, 전 세계 오피스의 구성원들이 이를 기반으로 다양한 산업과 시장에 영상 이해 기술을 적용해가고 있습니다. 세상의 복잡함을 이해하는 기술을 만드는 만큼, 서로 다른 배경과 관점을 가진 사람들이 모일 때 더 나은 제품을 만들 수 있다고 믿습니다.

아직 세상에 없는 답을 정의해보고 싶으신 분, 내 손으로 직접 변화를 만들어내고 싶어하시는 분을 찾고 있습니다. 트웰브랩스에서 세상을 이해하는 기술을 함께 만들어가세요.

About Pegasus

Pegasus는 “영상은 많지만 실제로 활용 가능한 데이터는 부족하다“는 문제를 해결하기 위해 만들어진 Video Understanding 모델입니다.

기존의 Video AI는 주로 영상 전체를 요약하거나 질문에 답하는 수준에 머물러 있었습니다. 하지만 실제 비즈니스 환경에서는 단순 요약만으로는 충분하지 않습니다. 기업들은 특정 장면이 언제 등장했는지, 어떤 이벤트가 어느 시점에 발생했는지, 그리고 이를 어떻게 검색·분류·아카이빙·편집 시스템과 연결할 수 있는지를 필요로 합니다.

Pegasus는 이 지점을 해결합니다. 영상의 비주얼, 음성, 오디오, 화면 내 텍스트를 종합적으로 이해하고, 이를 시간 기반(Time-aware)의 구조화된 데이터로 변환합니다. 대표 기능인 Segment는 고객이 원하는 구간 유형과 메타데이터 스키마를 직접 정의할 수 있게 해주며, Pegasus는 영상 속 관련 장면의 시작과 종료 시점을 찾아 제목, 요약, 인물, 주제, 비주얼 요소, 도메인 특화 라벨 등의 정보를 구조화된 형태로 반환합니다.

즉 Pegasus의 핵심은 단순히 “영상 내용을 이해하는 것“이 아닙니다. 영상을 실제 프로덕션 환경과 비즈니스 워크플로우에서 바로 활용 가능한 데이터 시스템으로 변환하는 것입니다. Pegasus는 단순한 Video LLM 을 넘어서, 검색(Search), 아카이빙(Archive), 컴플라이언스(Compliance), CMS, 콘텐츠 운영 자동화 등 다양한 영역의 기반 인프라 역할을 수행합니다.

페가수스, 알면 알수록 재밌다. 더 파헤쳐보기!

About the Team

Pegasus 팀은 TwelveLabs의 비디오 이해(Video Understanding) 역량의 중심에 있는 조직으로, 자사의 핵심 Video Analysis 제품인 Pegasus를 개발하고 있습니다.

높은 instruction-following 성능과 복잡한 계층형 결과물을 생성할 수 있는 멀티모달 비디오 분석 시스템 구축에 집중하고 있으며, 단순한 리서치에 머무르기보다 실제 사용자에게 가치를 제공하는 제품을 빠르게 시장에 선보이는 것을 중요하게 생각합니다. 이를 위해 ML 리서처와 엔지니어가 함께 목표 중심(goal-oriented)의 크로스펑셔널 조직으로 긴밀하게 협업하고 있습니다.

팀의 업무는 매우 폭넓은 엔지니어링 과제를 아우릅니다. 멀티모달 LLM 개발을 위한 프리트레이닝부터 RL까지의 학습 인프라 구축, 실제 프로덕션 환경에서의 시간 기반 세그멘테이션 및 구조화된 메타데이터 생성 시스템 개발, 하나의 요청만으로 수 시간 분량의 비디오를 처리할 수 있는 대규모 추론 시스템 설계, 그리고 모델 품질 향상과 빠른 반복 개발을 위한 데이터 큐레이션 및 평가 파이프라인 구축 등을 담당하고 있습니다.

또한 NVIDIA B300을 포함한 세계 최고 수준의 AI 컴퓨팅 인프라를 활용해 비디오 분석 시스템의 한계를 확장하고 있으며, 연구에서 프로덕션까지 이어지는 사이클을 가능한 빠르게 가속하는 것을 지향하고 있습니다.

In this role, you will

You may be a good fit if you have

Preferred qualifications

Hiring Process

Application Review → Recruiter Interview (비대면/30분) → Loop Interview [Hiring Manager Interview&Live Coding Test Interview] (대면/약 90분) → System Design Interview(대면/약 90분) → Final Round Interview (비대면/약 45분) → Reference Check → Offer

Benefits and Perks

Interested in This Role?

Apply at Twelve Labs

You'll head to Twelve Labs's own careers page.