Media Forward Deployed Engineer란 무엇인가. 방송과 스트리밍에 빠져 있는 AI 직무

이 기사는 AI를 사용하여 영어에서 번역되었습니다. 원문 읽기

금융과 국방에는 Forward Deployed Engineer가 있습니다. 미디어에는 없습니다. 데이터가 초당 25프레임으로 흐르고 장애가 방송 중에 일어나는 세계에서 이 직무가 어떤 모습인지 정리했습니다.

지난 18개월 동안 소프트웨어 업계에서 가장 빠르게 늘어난 직함은 기업용 AI 바깥에서는 거의 아무도 들어본 적 없는 이름이었습니다. Forward Deployed Engineer 채용 공고는 2025년 1월부터 9월 사이에 800% 넘게 늘었고, 2026년으로 넘어오며 전년 대비 1,000% 넘게 증가했습니다. OpenAI는 이 직무를 축으로 사업체 하나를 통째로 세웠고, 40억 달러가 넘는 자금이 뒷받침하고 있습니다. Anthropic은 Blackstone 및 Goldman Sachs와 15억 달러 규모의 합작을 맺었는데, 그 유일한 목적은 이런 엔지니어를 은행 내부에 배치하는 것입니다.

은행에는 있습니다. 국방에도 있습니다. 의료에도 있습니다. 2026년 내내 NAB와 IBC에서 에이전트형 AI를 사들인 방송과 스트리밍 업계에는 대체로 없습니다.

iReplay Video Quality Analyzer의 프레임 단위 비트레이트 차트. 주황색 IDR 키프레임 봉우리가 장면 전환 감지 점선 위에 정확히 놓이고, 각 프레임의 그림이 해당 막대 아래에 표시됨

위 차트는 실제 HLS 스트림의 한 세그먼트이며 프레임마다 막대 하나입니다. 높은 주황색 봉우리가 키프레임이고, 장면 전환을 표시하는 점선 위에 놓입니다. 이 일치가 바로 이 글의 주장을 한 장으로 보여 줍니다. 인코더는 내용이 어디에서 바뀌는지 이미 계산했고, 그 답을 파일 안에 적어 두었습니다. 영상을 향한 대다수의 AI 파이프라인은 그것을 무시하고, 같은 계산을 다시 시키려고 모델에 비용을 지불합니다.

이 글은 빠져 있는 직무를 정의해 보려는 시도입니다. 일 자체는 이미 존재하는데, 그 일을 하는 사람들에게 붙일 이름이 없기 때문입니다.

Forward Deployed Engineer란 실제로 무엇인가

이 방식은 Palantir에서 왔고, 이 회사는 약 20년 동안 실행해 왔습니다. Forward Deployed Engineer는 고객사에 들어가 고객의 환경 안에서 일하며, 시스템을 처음부터 끝까지 소유합니다. 범위를 정하고, 운영 코드를 작성하고, 서비스가 시작된 뒤에도 계속 돌아가게 합니다.

컨설팅과의 차이는 한 문장이면 충분합니다.

컨설턴트는 보고서를 납품한다. Forward Deployed Engineer는 돌아가는 시스템을 납품한다.

이 직무가 폭발적으로 늘어난 이유는 유행이 아닙니다. MIT의 GenAI Divide 연구는 인터뷰와 설문에 더해 공개된 AI 도입 사례 300건을 살펴본 뒤, 기업 AI 시범 사업의 95%가 손익에 측정 가능한 영향을 주지 못했다고 밝혔습니다. 이 headline 숫자에는 타당한 방법론 비판이 있었고, 그 부분이 흥미로운 지점도 아닙니다. 흥미로운 것은 실패가 어디에 몰렸는가입니다. 모델 품질이 아니었습니다. 통합이었습니다. 유능한 모델을 실제 업무 흐름, 실제 데이터, 그리고 화요일 아침에 그것을 써야 하는 실제 사람들에게 연결하는 볼품없는 작업 말입니다.

같은 연구에서 전문화된 외부 팀의 성공률은 약 67%였고 내부 개발은 약 33%였습니다. 외부 인력이 더 좋은 모델을 가져서가 아닙니다. 전에 해 본 적이 있어서 어디에서 깨지는지 알았기 때문입니다.

미디어에 자체 버전의 직무가 필요한 이유

모든 업계가 자기네 데이터는 특별하다고 말합니다. 대부분은 틀렸습니다. 미디어는 예외 가운데 하나이고, 그 이유는 문화가 아니라 구조에 있습니다.

일반적인 AI 엔지니어는 텍스트, 표, 낱장 이미지로 경력을 쌓았습니다. 셋 다 작고, 접근하기 쉽고, 오차를 어느 정도 봐줍니다. 영상은 그중 어느 것도 아닙니다. 초당 25, 30, 50, 60프레임으로 들어오고, 자체 시계를 지니며, 법적으로 얽혀 있고, 흔히 암호화되어 있으며, 실패할 때는 정해진 시각에 관객 앞에서 실패합니다.

아래는 일반적인 AI 엔지니어가 배울 필요가 없었던 아홉 가지이며, 미디어 AI 프로젝트가 운영에 도달할지 아니면 그 95%에 합류할지를 가릅니다.

1. 영상은 컨텍스트 창이 아니다. 엔지니어링은 줄이는 일이다

90분 경기를 초당 25프레임으로 세면 135,000프레임입니다. 50fps면 270,000프레임입니다. 그것을 모델에 보낼 수는 없고, 순진한 해법인 N프레임마다 뽑기는 정작 중요했던 순간을 놓치거나 콘텐츠가 버는 것보다 더 많은 비용을 씁니다.

진짜 일은 모델이 애초에 어떤 프레임을 보게 할지 정하는 것이고, 그 신호 중 가장 싼 것은 이미 값을 치른 신호입니다. 인코더는 파일을 압축할 때 모든 프레임에 대해 판단을 내렸습니다. I프레임의 배치는 장면 전환을 표시합니다. 움직임 벡터는 무엇이 움직였는지 설명합니다. 프레임 유형은 복잡도가 어디에 있는지 알려 줍니다. CodecSight 같은 최근 연구가 이를 형식화합니다. 비싼 추론으로 다시 유도하는 대신, 코덱 신호로 시각 모델이 볼 곳을 이끄는 방식입니다.

무료인 저희 Video Quality Analyzer가 드러내는 것이 바로 이것입니다. I, P, B 프레임 유형, 프레임 재정렬, B프레임 연속 구간, 매크로블록 판단을 비트스트림에서 직접 읽어 냅니다. 그 차트에 있는 모든 것은 인코더가 이미 한 번 계산한 값이고, 대다수의 AI 파이프라인은 그것을 버립니다.

같은 발상의 더 강한 형태도 있습니다. id3as의 최고경영자이자 라이브 미디어 서버 Norsk를 이끄는 Adrian Roe는 16:9에서 9:16으로 자동 리프레이밍을 만드는 세 가지 방법을 설명했습니다. 객체 인식을 로컬에서 돌리기, 프레임을 클라우드 모델로 보내기, 또는 둘 다 하되 객체는 로컬에서 인식하고 모델에는 이미지 대신 그 결과인 좌표만 보내기입니다. 세 번째 방법은 토큰 사용량을 약 두 자릿수만큼 줄이고, 결과도 더 좋을 때가 많습니다. 질문과 무관한 방대한 픽셀에 대해 모델이 더는 추론하지 않아도 되기 때문입니다. 여기에서 적게 보내는 것은 타협이 아닙니다. 그것이 개선입니다.

2. 답은 4102번 프레임에 떨어져야 한다. 그 근처로는 안 된다

타임코드는 이 업계의 기본 키이고, 지뢰밭이기도 합니다. 드롭 프레임과 논드롭 프레임. 29.97과 30. 표시 타임스탬프와 디코딩 타임스탬프. 벽시계와 미디어 시계. EXT-X-PROGRAM-DATE-TIME, 그리고 상류의 누군가가 그것을 제대로 넣었는지 여부.

「골은 42:17쯤에 나옵니다」라고 보고하는 AI 시스템은 프레임 단위로 잘라야 하는 편집자에게 아무 쓸모가 없습니다. 일반적인 AI는 대략을 내놓습니다. 방송은 정확을 요구하고, 그 둘이 왜 다른지 아는 것이 이 일의 대부분입니다. B프레임 재정렬을 데이터 과학자에게 설명해 본 적이 없고, 같은 문장에서 4102번 프레임이 화면에 나오는 4102번째 프레임이 아니라는 것까지 설명해 본 적이 없다면, 아직 이 일을 해 본 것이 아닙니다.

3. 모델이 어디에서 돌아가는지는 계약의 문제이지 취향이 아니다

방송 전 마스터를 제삼자 API로 보내는 일은 배급 계약 위반, 보도 유예 파기, 또는 스튜디오가 부과한 콘텐츠 보안 조건 위반이 될 수 있습니다. TPN, MovieLabs, CDSA의 요구 사항은 권고가 아니며, 「클라우드 API를 썼습니다」는 변명이 되지 않습니다.

같은 제약의 더 가혹한 형태도 있습니다. 암호화된 스트림은 디코딩할 수 없습니다. 실제 픽셀이 필요한 품질 지표는 DRM이 개입하는 순간 전부 선택지에서 사라지고, 코드 한 줄 쓰기 전에 상당수의 설계가 죽습니다. 저희 Stream Analyzer는 DRM을 감지하고 디코딩에 기반한 모든 지표를 그 여부에 묶어 둡니다. 측정했을 리 없는 수치를 자신 있게 보고하는 것이 아무것도 보고하지 않는 것보다 나쁘기 때문입니다.

무엇을 봐서는 안 되는지 아는 것이 설계의 절반입니다.

4. 여기에서 품질에는 숫자가 있고, 누군가 거기에 서명한다

VMAF. PSNR. SSIM. 라우드니스를 위한 EBU R 128과 ATSC A/85. Apple의 HLS 오서링 규격. 이 업계는 「보기에 괜찮다」로는 부족하다고 오래전에 결론 내리고, 대신 측정을 만들었습니다.

VMAF 곡선을 첨부하지 않은 채 똑똑한 AI 기반 인코딩 래더를 제안하는 엔지니어는, 발상이 아무리 좋아도 어떤 방송사도 승인할 수 없는 것을 제안한 셈입니다. 그 숫자는 관료주의가 아닙니다. 수백만 대의 기기로 나갈 변경에 사람이 자기 이름을 적어 넣는 방식입니다.

선언 대역폭 3.30 Mbps 대비 4.03 Mbps로 측정된 세그먼트를 보여 주는 Video Quality Analyzer 요약. 프레임 수, 키프레임 비율, 최댓값 대 평균 비율 포함

실제로는 이렇게 보입니다. 이 세그먼트는 선언된 최댓값 3.30 Mbps에 대해 4.03 Mbps로 측정됩니다. 매니페스트를 믿은 플레이어는 이에 비해 용량이 부족하고, 여유 없는 회선에서는 바로 그렇게 재버퍼링이 시작됩니다. 평균이 괜찮아 보였기 때문에 아무도 알아채지 못했습니다. 평균은 이런 종류의 문제가 숨는 자리이고, 그래서 이 업계는 바라보는 대신 측정합니다.

5. 단위 경제성이 곧 시범 사업이다

대부분의 업계에서 AI 비용의 단위는 요청 한 건입니다. 미디어에서는 콘텐츠 한 시간이고, 아카이브는 수만 시간에 이릅니다.

미디어 AI 프로젝트가 실제로 죽는 곳이 여기입니다. 정확도가 아니라 산수입니다. 시연에서는 사소해 보이던 자산당 비용이 라이브러리를 향하는 순간 여섯 자리 청구서가 됩니다. 생방송 자막 같은 실시간 작업은 상시 가동 GPU에서 5초 미만의 지연을 요구합니다. 아카이브 일괄 분석은 야간의 저렴한 비피크 연산 자원에서 돌릴 수 있습니다. 업무 흐름의 어느 부분을 어느 통에 넣을지 정하는 것이 그 프로젝트에서 가장 값진 단일 결정이고, 그 결정은 누군가 코드를 쓰기 전에 내려집니다.

지연도 같은 예산에 속합니다. 클라우드 모델을 한 번 왕복하는 데 보통 2초에서 10초가 들며, 이는 야간에 아카이브에 태그를 붙이기에는 충분하고 생중계를 따라가야 하는 일에는 실격입니다. 여기에서 따라 나오는 규칙을 미디어 엔지니어링 회사 Qualabs의 최고경영자 JP Saibene가 잘 표현했습니다. 비싼 경로가 기본값이 아니라 예외가 되도록 설계하라는 것입니다. 방송은 1080p로 설정한 인코더가 1080p를 내놓고 청구액을 미리 알 수 있는 세계에서 수십 년을 보냈습니다. 사용량 과금 추론은 그 두 가지 확실성을 한꺼번에 없애고, 할당량을 붙이지 않은 시연이야말로 클립 하나가 결국 100달러를 쓰게 되는 경로입니다.

스트리밍은 전송 쪽에서 이 산수의 한 버전을 이미 겪었습니다. 거기에서 의미가 있었던 숫자는 시연에서 스트림 하나의 비용이 아니라 규모에서의 아웃바운드 트래픽이었고, 그것을 미리 계산한 팀들이 마진을 지켰습니다. 추론은 다른 계산이지만 같은 습관이며, 미디어 AI 프로젝트가 아카이브와의 접촉에서 살아남을지를 정하는 것이 그 습관입니다. 저희 CDN Cost Optimizer는 전송 쪽에 대해 그 일을 합니다.

6. 화면 안에서 무엇이 중요한지 정하기

세로형 배포를 위해 16:9를 9:16으로 다시 잡는 일은 단순한 자르기처럼 들립니다. 실제로는 현저성 문제입니다. 어떤 피사체가 그 장면을 지탱하는지, 주의가 언제 옮겨 가는지, 그리고 두 사람이 화면 양 끝에서 말할 때 무슨 일이 벌어지는지. 판정은 프레임 단위로 사람이 하며, 봐주는 법이 없습니다.

이것은 대본이 아니라 픽셀에 적용된 진짜 AI이고, 모두가 과소평가하기 때문에 면접 주제로 훌륭합니다. 저희 도구 Vertical Reframe은 여전히 베타로 표시되어 있는데, 그 표시는 겸손이 아닙니다. 문제에 대한 현황 보고입니다.

그 이유는 분명히 말할 가치가 있습니다. 이 분야의 상태를 말해 주기 때문입니다. 이 도구는 실제로 보는 일을 어떤 시각 모델이 맡을지 고르게 합니다. Claude, Gemini, GPT, Grok, Llama, Qwen, Pixtral, Ollama를 통한 로컬 모델, 또는 가지고 계시다면 직접 만든 모델. 이 선택지는 자랑스럽게 추가한 기능이 아닙니다. 어떤 모델이 이 일을 잘하는지에 대한 정해진 답이 없기 때문에 존재합니다. 콘텐츠가 다르면 이기는 모델도 다르고, 실패 양상은 어떤 벤치마크가 시사하는 것보다 폭이 넓기에, 선택을 대신 내리지 않고 드러내 두는 것입니다.

그것이 무엇을 뜻하는지 눈여겨보십시오. 리프레이밍을 훨씬 넘어 일반화되기 때문입니다. 어떤 역량이 성숙하면 아무도 모델 선택기를 출시하지 않습니다. 답을 출시합니다. 선택기는 이 분야가 아직 수렴하지 않았다는 자백이고, 자동 리프레이밍 위에 프로젝트를 계획하는 사람은 누군가 클립을 골라 놓은 시연 영상을 믿는 대신 그 사실을 비용에 넣어야 합니다. 그것은 또한 오래가는 엔지니어링이 실제로 어디에 있는지도 알려 줍니다. 이 문제가 풀리기 전에 여러 번 교체될 모델이 아니라, 그 주변의 장치입니다. 어떻게 표본을 뽑는지, 출력을 어떻게 평가하는지, 그리고 답이 명백히 틀렸을 때 무슨 일이 일어나는지.

그 실패의 모습은 그려 볼 가치가 있습니다. Norsk는 펜싱 경기에서 자동 리프레이밍을 시연했습니다. 본질적으로 가로로 긴 종목이라 일부러 가혹하게 잡은 시험입니다. 모델은 배경에 걸린 두 펜싱 선수의 큰 포스터에 고정되어 그것을 화면에 담았고, 실제 선수들은 무시했습니다. 펜싱이 어떻게 생겼는지를 헷갈린 것이 아닙니다. 펜싱 자체보다 더 펜싱처럼 보이는 것을 찾아낸 것입니다. 피사체 추적 시스템은 모두 이 실패의 자기 버전을 안에 품고 있고, 관객이 찾기 전에 자기 것을 찾아내는 일이 바로 그 일입니다.

7. 방송 체인 속 AI 시스템은 SLA를 가진 구성 요소이지 시연이 아니다

챗봇의 환각 답변은 성가신 정도입니다. 생방송 텔레비전의 환각 자막은 규제 기관이 따라붙는 접근성 결함입니다. 현재의 음성 인식은 깨끗한 방송 대사에서 단어 오류율 5% 미만에 이르며 이는 사람 속기사와 정말로 견줄 만하지만, 그렇다고 감독 없이 송출해도 안전하다는 뜻은 아닙니다.

효과가 있는 방식은 신뢰도 임계값, 위험이 정당화하는 지점에서의 사람 개입, 그리고 모델을 쓸 수 없거나 모델이 확신하지 못할 때를 위한 결정론적 대체 경로입니다. 업무 흐름의 어느 부분이 확률적 출력을 견딜 수 있는지 아는 것은 정책의 문제가 아니라 설계 역량입니다.

사후에 감사할 수 있어야 하기도 한데, 구성 요소가 확률적일 때 이는 들리는 것보다 어렵습니다. Norsk가 자동 광고 삽입에 대해 설명한 실무는 형태가 옳습니다. 모델로 보낸 모든 프레임을, 그 프레임 직전과 직후의 모델 상태와 함께 기록하는 것입니다. 무언가가 잘못된 순간에 나갔을 때, 시스템이 무엇을 믿었고 무엇이 그 판단을 바꿨는지 재구성할 수 있습니다. 방송은 체인의 다른 어떤 구성 요소에 대해서도 왜 그런 일이 일어났는지 늘 답할 수 있었습니다. AI 구성 요소만 답을 만들기 어렵다는 이유로 그 질문에서 면제되지는 않습니다.

저희 AI Ad Generator는 이것이 얼마나 드는지 보여 주는 정직한 사례입니다. 모델은 그중 가장 작은 부분입니다. 나머지는 렌더 팜, 작업 큐, 취소 처리, 멈춘 작업을 치우는 청소기, 탭을 닫은 사용자에게 알리는 웹 푸시, 결제, 그리고 아카이브입니다. 이 비율이 바로 실제 사용자에게 AI를 전달한다는 것의 모습입니다.

8. 미디어 시스템은 프로젝트보다 오래 산다

24시간 채널은 납품되는 것이 아니라 넘겨집니다. 누군가는 새벽 세 시에 그것을 돌려야 하고, 그 사람은 구조를 정한 회의 자리에 없었습니다.

운영에서만 나오는 종류의 지식을 구체적으로 들겠습니다. 저희 플랫폼 전반에서 H.264 인코딩 레벨은 서로 다른 세 개의 코드 경로에서 고정되어 있고 동일합니다. 하나만 바꿔도 불연속 경계에서 재생이 깨집니다. 스트림 중간에 레벨이 바뀌면 일부 디코더가 초기화되기 때문입니다. 이것은 논문에서 배울 수 없습니다. 한 소재가 다음 소재에 바통을 넘기던 바로 그 순간에 끊겼던 채널에서, 그리고 이유를 알아내는 데 걸린 일주일에서 배웁니다.

이것이 「forward deployed」라는 말이 하는 일입니다. 산출물은 시연한 날에 작동한 시스템이 아닙니다. 당신이 없는 밤에 다른 누군가가 돌릴 수 있는 시스템입니다.

9. 다음으로 제대로 만들어야 할 것은 에이전트 표면이다

에이전트는 이제 미디어 시스템을 직접 조작할 수 있습니다. 저희는 MCP를 통해 AI 에이전트로 24시간 TV 채널을 운영하는 일에 대해 썼는데, 흥미로운 질문은 에이전트가 채널 편성을 짤 수 있느냐가 아니었습니다. 짤 수 있습니다. 질문은 어떤 열아홉 개의 도구를 열어 줄 것인가, 가동 중인 플레이아웃 시스템에서 에이전트가 무엇을 건드리게 허용할 것인가, 그리고 새벽 두 시에 확신에 차서 틀렸을 때 무슨 일이 벌어지는가입니다.

누군가는 그 표면을 설계해야 합니다. 그 사람은 양쪽 절반을 모두 이해해야 합니다.

실무자가 소리 내어 말하면 이렇게 들린다

위의 어느 것도 이론이 아니고, 이렇게 주장하는 사람이 저 혼자도 아닙니다. When AI Runs The Stream이라는 웨비나는 이것을 생업으로 만드는 두 사람을 한 시간 동안 같은 자리에 앉히고, 두 사람은 전혀 다른 방향에서 위의 아홉 가지 대부분에 도달합니다.

Adrian Roe는 id3as의 공동 창업자이자 최고경영자입니다. 이 회사는 Norsk를 만드는데, 스트리밍 업무 흐름을 코드로 구성하는 데 쓰이는 라이브 미디어 서버와 SDK입니다. JP로 불리는 Juan Pablo SaibeneQualabs의 공동 창업자이자 최고경영자입니다. 몬테비데오의 엔지니어링 회사이며, 그 팀들은 미국과 유럽의 영상 기술 기업과 미디어 기업의 엔지니어링 조직 안에 들어가 일합니다. 진행은 Eric Schumacher-Rasmussen이 맡았습니다.

두 번째 설명을 다시 읽어 보십시오. 그것이 바로 이 글 전체의 주장을 회사 소개 형태로 적어 놓은 것이기 때문입니다. 미디어 고객사 자체 조직 안에 엔지니어를 들여보내 물건을 만들고 돌아가게 하는 일이 forward deployed engineering입니다. 우리 업계에서 이미 벌어지고 있습니다. 다만 아직 이름이 없을 뿐입니다.

그 한 시간이 시간을 쓸 값어치가 있는 이유는 두 사람 모두 쉬운 버전을 팔지 않기 때문입니다. 그들이 계속 되돌아가는 질문은 AI가 생방송 스트림에 무언가를 할 수 있느냐가 아닙니다. 진짜 관객 앞에서, 진짜 예산으로, 이미 돌아가는 것을 망가뜨리지 않으면서, 천 번을 돌려도 매번 그 결과를 믿을 수 있느냐입니다.

거기에서 나온 세 가지 방식은 그대로 가져올 만합니다. 셋 다 모델 선택이 아니라 설계 결정이기 때문입니다.

실수가 싸게 먹히도록 설계하라

어떤 일이 애초에 AI에 맞는지 가리는 Adrian Roe의 시험은 세 가지 질문으로 압축됩니다. 모델의 강점을 살릴 만큼 문제를 좁게 잡을 수 있는가. 타이밍에 여유가 있는가. 그리고 틀렸을 때 그 실수가 싼가.

예시들이 배울 만한 이유는 바로 화려하지 않기 때문입니다. 테니스 코트 체인지 때 광고를 자동으로 넣는다면, 전체 화면 중단 대신 L자 배너나 스퀴즈백을 쓰십시오. 타이밍이 어긋난 L자 배너는 약간 거슬리는 정도지만, 타이밍이 어긋난 전체 화면 중단은 그 순간을 망가뜨립니다. 품질 점수로 이중화된 두 회선을 전환한다면, 양쪽이 모두 건강할 때 전환은 끊김이 없으므로 불필요한 전환은 시청자에게 아무 비용도 물리지 않습니다. 설계를 제대로 하면 모델은 가끔 틀려도 되고, 그것이 애초에 운영에 올릴 수 있는 유일한 조건입니다.

모델의 답을 결정론적인 답으로 바꿔라

고객사 엔지니어링 조직 안에 팀이 들어가 있는 Saibene는 깔때기 형태로 만든 체감 품질 진단 시스템을 설명했습니다. 첫 층은 이동 창에 대한 단순한 임계값이며 AI가 전혀 없고, 무언가 잘못되었는지 여부만 답합니다. 둘째 층은 이상을 이미 본 적 있는 원인들과 맞춰 보는데 이 역시 결정론적입니다. 앞의 두 층이 익숙한 것을 찾지 못했을 때에만 도달하는 셋째 층이 열린 질문을 모델에 넘깁니다.

중요한 것은 그다음에 벌어지는 일입니다. 모델이 정말 새로운 장애에 대한 설명을 내놓아도 그대로 실행하지 않습니다. 경험 있는 엔지니어에게 제시하고, 그 사람이 승인하면 그 장애는 결정론적 층으로 옮겨 가 다시는 모델을 거치지 않고 진단됩니다. 사람은 거기에, Saibene의 표현대로 「안심 담요가 아니라 장치로서」 있습니다. 시스템은 오래 돌릴수록 더 결정론적이 되고 운영 비용도 낮아집니다. 대다수 AI 도입이 나이 드는 방식과 정반대입니다.

병목은 옮겨 갈 뿐 사라지지 않는다

Saibene의 두 번째 사례는 대다수 팀이 오리라 예상하지 못한 것입니다. 생성 도구는 클립 수천 개를 만들 수 있지만, 그 하나하나는 나가기 전에 여전히 누군가 확인해야 합니다. 생성이 싸졌다고 제약이 사라지지는 않았습니다. 만드는 일에서 검증하는 일로 옮겨 갔을 뿐이고, 검증은 아무도 자동화하지 않은 부분입니다.

그러니 흥미로운 제품은 하이라이트 생성기 하나가 더 나오는 것이 아닙니다. 검증기입니다. 클립과 규격을 주면 게시 가능인지 아닌지 판정이 돌아옵니다. 그 검사 중 일부는 순수한 산수로, 잘라 낸 결과가 정말 9:16인지 확인하는 식입니다. 다른 일부는 정말로 판단이 필요합니다. 후원사가 실제로 보이는지, 해설이 화면의 상황과 맞는지 같은 것입니다. 어느 쪽이 어느 쪽인지 아는 것이 설계의 전부입니다.

같은 한 시간에서 조금 더 작은 두 가지도 챙길 만합니다. 여든 개쯤의 숫자가 늘어선 생방송 모니터링 화면에 대해 Roe는 그중 AI에서 오는 것은 둘뿐이며 그 비율이 부족한 것이 아니라 적절하다고 짚었습니다. 그리고 비용에 대해, 문제 전체를 압축한 Roe의 표현은 더 낫게 고치기 어렵습니다. 맥락이 왕이고, 맥락이 비용이며, 맥락이 지나치면 품질이 나빠진다.

Forward Deployed Engineer인가, 컨설턴트인가, 시스템 통합업체인가

이 업계에는 이미 훌륭한 컨설턴트도, 훌륭한 시스템 통합업체도 있습니다. 이 말들이 서로 바꿔 쓰이고 있지만 그래서는 안 되므로, 구분을 분명히 말할 가치가 있습니다.

역할받는 것그 뒤의 소유자
컨설턴트진단, 권고, 아키텍처당신, 맨바닥에서부터
시스템 통합업체어느 공급사의 제품, 설치와 설정 포함당신과 그 공급사
공급사 소속 Forward Deployed Engineer그 공급사의 제품을 당신의 구성에 맞춘 것공급사, 당신이 고객으로 남아 있는 동안
독립 미디어 FDE당신의 환경에서 돌아가는 코드당신, 방법은 팀에 이전된 상태로

공급사 내부에서는 이 역할이 이미 현실입니다. Bitmovin과 CAMB.AI 모두 현재 forward deployed broadcast 또는 streaming engineer라는 직함으로 채용을 내고 있으며, 자사 엔지니어링 팀과 주요 미디어 고객 사이에 배치하고 있습니다. 이는 강한 신호입니다. 문제에 가장 가까운 회사들이 업계의 나머지가 이 일에 이름을 붙이기도 전에 이 사람이 필요하다는 것을 알아챘다는 뜻입니다.

독립 인력과의 차이는 단순하고, 공급사에 대한 비판도 아닙니다. 공급사의 Forward Deployed Engineer는 제품 하나를 맞춰 넣으라고 보수를 받습니다. 독립 인력은 당신이 차라리 교체하고 싶은 부분까지 포함해 당신의 구성 전체가 돌아가게 하라고 보수를 받습니다.

무언가에 서명하기 전에 생각해 볼 전략적인 형태도 있습니다. 에이전트가 미디어 업무 흐름을 조율하기 시작하면, 가치 있는 층은 모델이 아닙니다. 모델은 이번 십 년 안에 여러 번 교체됩니다. 가치는 조율 계층과 그 아래의 맥락에 있습니다. 당신의 자산, 당신의 규칙, 당신의 운영 지식 말입니다. Qualabs의 JP Saibene는 이 주제에 관한 Andy Beach의 작업을 언급하며 위험을 분명히 말합니다. 아래의 맥락을 당신이 갖지 못한 채 공급사가 그 층을 소유하게 두면, 결국 당신 자신의 업무 흐름을 공급사에서 도로 빌려 쓰게 됩니다. 그 층을 당신을 위해 만드는 사람은, 당신이 계속 가질 수 있도록 만들어야 합니다.

진짜인지 알려 주는 다섯 가지 질문

이 자리를 채용한다면 이력서는 도움이 되지 않습니다. 요즘은 모든 이력서에 AI라고 적혀 있습니다. 이 다섯 질문은 영상을 운영에 올려 본 사람과 API에 텍스트만 보내 본 사람을 갈라놓습니다.

1. 「4만 시간짜리 아카이브에 자동으로 태그를 붙이려 합니다. 비용 모델을 설명해 주세요.」

모델이 아니라 단위에서 시작하기를 바랍니다. 콘텐츠 시간, 시간당 비용, 일괄 처리 대 실시간, 그리고 비피크 시간대에 무엇을 돌릴지. 어떤 모델을 고르겠다는 말로 시작한다면, 그 사람은 이런 기획이 재무 책임자 손에 무산되는 경험을 해 본 적이 없습니다.

2. 「저희 마스터는 DRM으로 보호됩니다. 그러면 접근 방식이 어떻게 달라집니까.」

옳은 답은 디코딩이 필요한 모든 것이 배제되고, 컨테이너 수준 메타데이터, 별도 파일, 또는 암호화 이전 지점에서의 분석 쪽으로 밀린다는 것입니다. 틀린 답은 열의입니다.

3. 「모델이 하이라이트가 42:17이라고 합니다. 그걸로 뭘 하면 됩니까.」

들어야 할 것은 프레임 정확도, 타임코드 형식, 그리고 그 출력이 EDL, SCTE-35 마커, 또는 MAM 레코드를 구동할 수 있는지입니다. 「타임스탬프를 드립니다」는 답이 아니라 질문을 되풀이한 것입니다.

4. 「두 시간짜리 소재에서 프레임을 어떻게 표본으로 뽑습니까.」

N프레임마다는 약한 답입니다. 샷 경계 검출은 괜찮은 답입니다. 인코더가 이미 만들어 둔 I프레임 배치와 움직임 벡터를 쓴다는 것이, 규모에서 추론 비용을 실제로 치러 본 사람의 답입니다.

5. 「생방송 도중 모델을 쓸 수 없게 되면 어떻게 됩니까.」

결정론적 대체 경로와 정의된 축소 운영 모드가 있어야 합니다. 답이 재시도뿐이라면 그 시스템은 방송에 나가 본 적이 없습니다.

비용과 돌아와야 할 것

떠도는 숫자에 대해 한마디 하겠습니다. Forward Deployed Engineer의 총보상으로 30만에서 120만 달러가 인용되고 그 자체는 실재하지만, 이는 미국 최전선 AI 연구소의 정규직 패키지를 가리키며 주식 비중이 매우 큽니다. 미디어가 지불하는 금액도 아니고, 유럽의 독립 전문가가 청구하는 금액도 아닙니다. 그 숫자들은 시장이 이 직무를 재평가하고 있다는 증거로 읽어야지 요금표로 읽어서는 안 됩니다.

측정할 가치가 있는 쪽은 반대편입니다. 그 95%의 비용이란 한 팀의 1년 치 주의를 삼키고 아무것도 내놓지 못한 시범 사업입니다. 그에 비하면 관건은 일당이 아닙니다. 지금 잡힌 범위대로라면 아카이브 규모에서 예산의 네 배가 들 것이라고, 혹은 DRM 때문에 제안된 방식이 불가능하다고 누가 얼마나 빨리 말해 주느냐, 그리고 그다음에 작동하는 버전을 만들어 낼 수 있느냐입니다.

그 대화는 3분기가 아니라 첫 주에 이뤄져야 합니다.

자주 묻는 질문

Media Forward Deployed Engineer란 무엇입니까?
방송사, 스트리밍 서비스, 또는 미디어 기업에 들어가 그들의 환경 안에서 AI 시스템을 처음부터 끝까지 소유하는 엔지니어입니다. 범위를 정하고, 운영 코드를 작성하고, 계속 돌아가게 합니다. 일반적인 Forward Deployed Engineer와의 차이는 영상과 음성 분야의 깊이, 즉 코덱, 타임코드, 스트리밍 프로토콜, 콘텐츠 보안, 그리고 아카이브 규모로 콘텐츠를 처리하는 경제성입니다.

Forward Deployed Engineer는 컨설턴트와 어떻게 다릅니까?
컨설턴트는 보고서나 아키텍처를 내놓고 구축은 당신에게 맡깁니다. Forward Deployed Engineer는 당신의 환경 안에서 운영 코드를 작성해 납품하고, 그다음 그 방법을 당신 팀에 이전합니다. 산출물은 문서가 아니라 돌아가는 시스템입니다.

왜 그렇게 많은 미디어 AI 프로젝트가 실패합니까?
MIT의 연구는 기업 AI 시범 사업의 95%가 측정 가능한 재무 효과를 내지 못했고, 실패가 모델 품질이 아니라 통합에 몰렸음을 밝혔습니다. 미디어에는 특히 두 번째 흔한 원인이 있습니다. 단위 경제성입니다. 자산 하나당으로 보면 무시할 만해 보이는 비용이 수만 시간의 아카이브 전체에서는 감당할 수 없게 되고, 그 산수는 시범 사업 전이 아니라 후에 이뤄지기 일쑤입니다.

일반적인 AI 엔지니어가 이 일을 할 수 있습니까?
일부는 가능하고, 바로 거기에 함정이 있습니다. 설득력 있는 시제품은 빠르게 만들 수 있습니다. 대개 빠지는 것은 프레임 단위 타임코드 처리, 암호화된 콘텐츠는 디코딩할 수 없다는 인식, SCTE-35 마커나 TTML 자막처럼 방송 체인이 실제로 받아들일 수 있는 출력을 만들어 내는 능력, 그리고 규모에 맞는 현실적인 비용 모델입니다. 이런 구멍은 보통 시범 사업이 승인된 뒤에 드러납니다.

정규직으로 한 명 뽑아야 합니까?
보통 처음에는 아닙니다. 이 역할은 불확실성이 가장 큰 지점, 즉 범위를 정하고, 무엇을 만들지 고르고, 첫 시스템을 운영에 올리는 국면에서 가장 값집니다. 많은 미디어 기업이 그 단계에 전문가를 들이고 이후에는 자체 팀으로 결과를 운영하는데, 방법 이전이 일의 일부이므로 그것이 의도된 결말입니다.

후보자에게 무엇을 물어야 합니까?
위의 다섯 질문이 비용 모델링, 콘텐츠 보안, 프레임 정확도, 표본 추출 전략, 방송 중 장애 시 거동을 아우릅니다. 미디어 AI 시스템을 운영에 올려 본 적 없이 설득력 있게 답하기는 어렵고, 해 본 사람에게는 쉽습니다.

어디에서 찾을 수 있는가

이 글 곳곳에 링크한 도구들은 무료로 써 보실 수 있습니다. 그것들이 요지는 아니지만 요지의 증거입니다. 하나하나가 운영 중에 나타난 문제로 시작했고, 슬라이드에 적어 설명하는 대신 제대로 풀어야 했던 것들입니다. 그중 하나는 여전히 베타인데, 이유는 본문에서 이미 설명했습니다.

방송이나 스트리밍 업무 흐름에 AI를 넣으려 하고 있고 어디에서 깨지는지 이미 아는 사람이 필요하다면, 역할을 적어 주십시오. 누가 전화를 들기 전에 정직한 일당까지 포함해 함께 범위를 잡아 드리겠습니다.

채우려는 역할을 적어 주세요

그리고 위의 아홉 가지를 읽으며 자기 일이라고 느끼셨다면, 지금 이 순간 이 일에 이름표가 붙고 있습니다. 그런 일이 벌어지면 일반 인력들이 나타나 그 이름을 차지합니다. 실제로 이 일을 해 온 사람들이 그 이름으로 먼저 발견되어야 합니다. 인재 네트워크에 참여하기.