차세대 카메라 경쟁의 핵심은 바로 '이해력'에 있다.

카메라 경쟁은 단순한 기술 사양을 넘어 장면을 이해하고 AI 기반의 스마트 사진을 촬영하는 방향으로 변화하고 있습니다.

가장 중요한 사항들

  • 센서의 기능은 인간의 눈을 위해 아름다운 이미지를 포착하는 것에서 기계가 처리할 수 있는 깨끗한 신호를 제공하는 것으로 바뀌어 필수적인 인지 도구가 됩니다.
  • 실시간 AI 처리의 병목 현상이 센서로 옮겨가면서, 온칩 처리, 이벤트 기반 센서, 범용 셔터, 기계 판독성을 향상시키는 수정된 HDR 기술과 같은 솔루션에 대한 요구가 증가하고 있습니다.
  • 차세대 카메라 경쟁은 센서, 이미지 처리 및 주변 컴퓨팅을 포함하는 통합 시스템을 중심으로 전개될 것이며, 전통적인 "이미지 품질"을 넘어 전략적 우선순위로서 "추론 품질"에 중점을 둘 것입니다.

저를 설득시킨 시연은 제가 직접 지은 미술관에서 이루어졌습니다.

가이드 팀을 꾸릴 수 없어서 제가 그 역할을 대신할 개인 프로젝트를 개발했습니다. 입력 상자 같은 건 없었어요. 스마트폰으로 사물을 가리키면 그게 뭔지 알려주는 방식이었죠. 전시회가 끝났는데도 사람들이 계속 사용하더라고요.

그들은 그에게 건물, 꽃, 아이들의 장난감, 거리의 포스터들을 가리키며 설명했는데, 이 모든 것들은 전시회와는 아무런 관련이 없었다.

누구의 요청도 없이, 그들은 카메라가 세상을 자신들에게 설명해 줄 수 있어야 한다고 결정했습니다.

이제 이러한 기대는 업계가 충족해야 할 책임이며, 인공지능이 학습 문제에서 추론 문제로 전환되는 시점에 나온 것입니다 . 즉, 대부분의 실제 작업은 사용자가 스마트폰을 협조적이지 않은 실제 세계에 향하게 하는 동안 기기 자체에서 이루어집니다.

모델에게 필요한 프레임은 사람의 눈과는 다릅니다. 모델에게는 기대어 볼 수 있는 가장자리와, 빛 반사나 흐릿함으로 인해 구도가 흐려졌을 때 다시 형태를 잡아줄 수 있는 구조가 필요합니다. 사진을 보기 좋게 만드는 색감과 명암은 모델에게는 오히려 방해 요소가 될 수 있습니다.

사람이 보는 데 필요한 센서와 모형에 사용할 센서는 서로 다른 설계가 필요합니다.

센서는 이제 인식의 문제로 바뀌었고, 실시간 비전 시스템을 개발하는 사람들은 과거 사진작가들이 그랬던 것처럼 이 문제에 대해 깊이 고민하고 있습니다.

그 센서는 어디서 온 건가요?

1990년대 초 에릭 포섬이 개발한 액티브 픽셀 CMOS 센서 덕분에 오늘날 거의 모든 사람의 주머니에 성능 좋은 카메라가 들어 있습니다.

그의 후기 연구는 완전히 다른 방향으로 나아갑니다. 바로 개별 광자를 계수하는 양자 이미지 센서입니다. 이러한 궤적은 현재 인공지능의 발전 과정을 보여줍니다. 사람이 좋아할 만한 장면을 포착하는 것에서 나아가 기계가 처리할 수 있는 가장 깨끗한 신호를 포착하는 방향으로 나아가고 있는 것입니다.

센서는 인지 도구가 되며, 사진 촬영은 그 용도 중 하나일 뿐입니다.

추론이 업무의 본질을 바꾸는 이유는 무엇일까요?

추론이야말로 문제를 시급하게 만드는 요소입니다. 이전에는 AI가 주로 학습에 초점을 맞추었기 때문에 카메라의 역할은 간접적이었습니다. 카메라가 제공하는 데이터는 나중에 분류되고 학습되는 데 사용되었으며, 학습 속도는 느렸습니다. 하지만 추론은 느리지 않습니다. 추론은 실시간으로 이루어지며, 특히 시간 제약이 있는 AI 애플리케이션 의 경우처럼 성능이 부족하고 이미 발열이 심한 기기에서 발생합니다.

카메라가 대상을 향하고 있는 동안 시스템이 대상을 인식하고 너무 늦기 전에 반응해야 할 때, 가장 취약한 연결 고리는 모델에 이르는 과정이며, 이는 제품의 모든 기능에 한계를 설정합니다.

업계의 일부는 여전히 잘못된 것에 기대를 걸고 있습니다. 충분히 큰 모델이 카메라에서 입력되는 모든 데이터를 처리할 수 있을 것이라는 가정입니다. 저는 이러한 가정이 2년 연속 제품 개발 로드맵을 저해하는 것을 목격했으며, 물리 법칙에도 위배된다고 생각합니다.

어떤 크기의 모델도 모션 블러나 빛 반사로 이미 손상된 디테일, 또는 모델이 프레임을 인식하기도 전에 뷰티 우선 처리 과정에서 제거된 디테일을 복원할 수는 없습니다. 이제 병목 현상은 센서와 모델 사이에 있는 부분으로 옮겨갑니다.

이 기기들은 실제로 어떤 기능을 하나요?

일부 센서는 이제 칩 자체에서 처리의 일부를 수행하므로 초기 계산은 데이터가 픽셀 배열을 떠나기 전에 완료됩니다. 이벤트 기반 센서(때때로 뉴로모픽 센서라고도 함)는 장면에서 변화하는 부분만 기록하므로 전체 프레임을 스트리밍하는 것보다 실시간 인식에 훨씬 더 적합합니다. 글로벌 셔터는 기계 판독값을 왜곡할 수 있는 모션 왜곡을 줄이는 데에도 도움이 됩니다.

하늘을 극적으로 표현하기 위해 오랫동안 개발되어 온 고화질 동적 범위(HDR) 기술조차도 이제는 모델이 고대비 환경에서 명확하게 인식할 수 있는 수준에 맞춰 재보정되고 있습니다. 이러한 기술들은 서로 다른 특징을 지니고 있지만, 모두 모델이 처리할 수 있는 수준의 세상을 구현하는 방향으로 나아가고 있습니다.

식별부터 결론까지

가장 직관적인 기능은 시각 검색입니다. 카메라를 사물에 비추면 해당 사물에 대한 라벨이 표시되는 것이죠. 하지만 스마트폰으로 메뉴판을 볼 때는 무엇을 먹을지 결정하는 데 도움이 필요하고, 포스터를 볼 때는 해당 이벤트를 캘린더에 저장하는 것이 유용할 수 있습니다. 사물 인식은 단지 시작점에 불과합니다. 제품의 핵심은 그 다음에 무엇을 해야 할지 아는 데 있습니다. 바로 이 지점에서 센서는 단순히 정보를 캡처하는 것을 넘어, 더 긴 해석 과정의 첫 번째 연결 고리가 됩니다.

저는 애초에 카메라 제품을 만들 생각은 없었습니다. 단지 전시회 하나를 위해 가이드를 고용하는 비용을 절약하려는 작은 방법으로 시작했을 뿐입니다. 하지만 이 작은 프로젝트를 통해 제 안에 이미 카메라에 대한 본능이 존재한다는 것을 깨달았습니다. 카메라 분야에서 제가 다음에 도전할 부분은 센서, 이미지 처리 경로, 주변 장치 컴퓨팅 , 모델 포맷, 그리고 궁극적으로 시스템이 수행하는 기능까지, 전체 시스템에 관한 것입니다.

하드웨어 제조업체들은 이미지 품질 향상에 수년간 공을 들여왔으며, 추론 품질 또한 그만큼 중요하게 여겨야 할 것입니다. 소프트웨어 개발자들은 신호 캡처를 남의 문제로 치부해서는 안 됩니다. 신호가 어떻게 캡처되고 전달되는지는 사용자가 화면을 보기 훨씬 전부터 결과에 영향을 미치기 때문입니다. 실시간 인식 기술이 발전함에 따라 하드웨어와 소프트웨어 사이의 기존 경계는 점점 모호해질 것입니다.

이 분야에는 여전히 스타트업이 활약할 여지가 있습니다. 스타트업의 강점은 문제 파악 속도입니다. 대기업들이 논쟁을 벌이기도 전에 문제를 먼저 파악하고 정의할 수 있다는 것이죠. 기존 모델의 능력 자체를 옹호하기는 점점 더 어려워지고 있습니다. 문제는 단일 시스템이 동일한 사건을 예측하고, 미래를 내다보고, 대응할 수 있게 되면 어떤 일이 벌어질 것인가, 그리고 누가 완벽하게 작동하는 제품을 먼저 선점할 것인가 하는 점입니다.

인간의 눈과 기계의 지능

제 생각에는 향후 몇 년 안에 기업들은 두 진영으로 나뉘게 될 것입니다. 하나는 사람의 눈에 최적화된 성능을 추구하는 기업이고, 다른 하나는 기계가 읽어야 할 내용에 최적화된 성능을 추구하는 기업입니다. 하지만 플래그십 스마트폰의 경우, 이러한 목표들이 여전히 상당 부분 겹치기 때문에 그 차이를 구분하기가 쉽지 않습니다.

하지만 전략적인 측면에서 이러한 목표들은 이미 서로 다른 방향으로 나아가기 시작했습니다. 가장 지속 가능한 입장은 혼란스러운 현실 세계를 기계가 추론할 수 있는 가장 깨끗한 신호로 변환할 수 있는 쪽이 될 것입니다.

이것은 센서에서 시작됩니다.

저희는 최고의 카메라폰들을 검토하고 평가하여 순위를 매겼습니다.

댓글이 닫혔습니다.