2026년 9월 22일, AI 업계는 세 갈래로 나뉘어 움직이고 있습니다. Anthropic은 Claude를 실제 연구 현장에 더 깊숙이 밀어 넣는 두 가지 소식을 동시에 내놓았고, OpenAI는 수학 연구·영상 제작·거버넌스라는 서로 다른 세 영역에서 각각의 행보를 공개했습니다. 여기에 모델 성능을 둘러싼 신뢰 문제를 해결하려는 새로운 시도도 등장했습니다. 오늘 검증된 6건의 소식을 통해 AI가 "도구"에서 "동료"로, 그리고 "연구 주체"로 옮겨가는 흐름을 짚어봅니다.
1. Anthropic, 생명과학 연구자를 위한 'LSVP' 베타 공개 — 고위험 접근은 6개월마다 재심사
Anthropic이 2026년 9월 17일 Life Sciences Verification Program(LSVP) 베타를 공개했습니다. 이 프로그램의 핵심은 AI 모델에 걸린 안전장치를 모든 사용자에게 획일적으로 적용하는 대신, 신청 기관의 자격과 보안 수준, 연구윤리 감독 체계를 검증한 뒤 그에 맞춰 접근 권한을 차등 부여한다는 점입니다. 지금까지 Claude는 생명과학 분야에서 오·남용 가능성 때문에 특정 질의나 작업을 보수적으로 차단해 왔는데, LSVP는 이 벽을 검증된 기관에 한해 낮추는 조건부 통로인 셈입니다.
접근 권한은 두 등급으로 나뉩니다. 먼저 'Standard Use(표준 권한)'는 팀 전체가 일상적으로 쓰는 생명과학 업무용으로, 기초과학과 연구개발뿐 아니라 공급망·제조, 임상 개발, 품질보증 업무까지 포괄하며 1년마다 갱신됩니다. 반면 'High-risk Use(고위험 권한)'는 표준 권한에서도 차단되는 민감한 작업에 한해 특정 프로젝트 단위로만 부여되고, 6개월마다 재심사를 거쳐야 합니다. 재심사 주기를 표준 권한의 절반으로 짧게 잡은 것은 고위험 작업일수록 연구 목적과 실제 사용 패턴이 어긋날 가능성을 더 촘촘히 점검하겠다는 뜻으로 읽힙니다.
신청 자격에도 제약이 있습니다. 개인 연구자가 아닌 팀·기관 단위로만 신청할 수 있고, 승인 이후에는 30일간의 사용 패턴을 감시하는 사후 모니터링이 적용됩니다. 지원 플랫폼도 Anthropic 콘솔과 Claude Enterprise·Team으로 한정되며, 개인용 Pro·Max 플랜에서는 이 프로그램을 이용할 수 없습니다. 또한 건강정보보호법(HIPAA)이 적용되는 보호대상건강정보(PHI)는 애초에 입력이 금지되어 있어, 프로그램이 임상 데이터 자체의 취급 범위를 넓혀주는 것은 아님을 분명히 하고 있습니다.
승인 범위를 벗어난 활동이 감지되면 조직 관리자에게 통보가 가고, 사전에 합의된 시간 내에 사건을 분류하고 시정 조치를 취해야 합니다. Anthropic은 이 프로그램의 승인 자체가 과학적 타당성이나 연구윤리 승인, 규제 적합성을 대신하는 것이 아니라는 점도 명확히 하고 있어, 최종적인 규제 준수 책임은 여전히 신청 기관에 있습니다. 신약 개발이나 임상 연구처럼 시간이 곧 생명과 직결되는 영역에서, AI 모델의 문턱을 낮추되 책임 소재는 기관에 남겨두는 절충안을 택한 셈입니다.
원문: Claude LSVP 베타 공개…고위험 접근은 6개월마다 재심사 (quasa.io)
2. Claude, Anthropic 자체 R&D의 26%를 "주도" — 그러나 완전 자율은 아니다
Anthropic이 자사 연구개발 업무 중 26%를 Claude가 "주도(lead)"하고 있다고 발표했습니다. 숫자만 보면 AI가 이미 연구의 4분의 1을 사실상 도맡고 있다는 인상을 주지만, Anthropic이 붙인 단서를 읽어보면 그 의미는 훨씬 제한적입니다. 26%는 완전 자율 수행 비율이 아니라, Anthropic이 자체적으로 정의한 자동화 단계 체계에서 AL4 '주도' 단계에 해당하는 업무의 비중입니다.
AL4 '주도' 단계란 Claude가 인간으로부터 상위 수준의 목표나 지시를 받은 뒤, 조사·수정·시험 등 실제 작업 대부분을 스스로 처리하는 상태를 말합니다. 다만 이 단계에서도 목표 설정, 결과 검토, 실제 배포 여부 결정은 여전히 인간의 몫으로 남아 있습니다. 즉 26%라는 수치는 코드 작성 비율이나 성과 기여도가 아니라, "많은 부분을 맡기되 최종 판단은 인간이 내리는" 업무가 전체의 4분의 1 수준에 도달했다는 뜻에 가깝습니다.
측정 방식도 눈여겨볼 대목입니다. Anthropic은 직원들의 업무 투입 시간을 가중치로 삼아 자료를 수집했고, Claude 에이전트를 활용해 1만 5천 개에 달하는 세부 업무를 추출·분류했습니다. 이렇게 자동 분류된 결과와 인간 평가자의 판단이 정확히 일치한 비율은 59%였으며, 한 단계 정도의 오차까지 허용하는 ±1단계 기준으로는 일치율이 97%까지 올라갔습니다. 이 수치들은 2026년 7월 자료를 기반으로 하며, 고정된 업무 분류 틀을 사용해 산출됐다는 점도 함께 공개됐습니다.
같은 발표에서 다른 지표도 함께 제시됐습니다. 특정 시점에 동시 실행되는 에이전트 규모는 약 3만 개로 집계됐는데, 이는 누적치나 조직의 인력 규모를 뜻하는 것이 아니라 순간적인 동시 실행량입니다. 또한 안전 관련 컴퓨팅 자원에 투입된 비중은 6%로 집계됐지만, 이 역시 일주일 동안의 측정치일 뿐 장기적인 투자 목표치는 아니라는 단서가 붙었습니다. 참고로 2026년 2월만 해도 이런 자동화 수준을 나타내는 지표들은 거의 0%에 가까웠던 것으로 알려져, 불과 반년 사이의 변화 폭이 상당히 가파르다는 점을 알 수 있습니다.
결론적으로 Anthropic은 "완전 자동화(AL5) 단계에 도달한 연구 영역은 아직 없다"는 점을 분명히 하며, 이 수치들이 독립적인 검증과 반복 측정을 거쳐야 하는 초기 단계의 자체 측정치임을 강조했습니다. AI가 연구 파이프라인에 깊이 들어와 있는 것은 분명하지만, 그 깊이를 정확히 수치화하는 방법론 자체가 아직 성숙 단계에 있다는 뜻이기도 합니다.
원문: Claude의 Anthropic 연구개발 주도율 26%, 완전 자율은 아니다 (quasa.io)
3. OrcaRouter, 벤더 제출 점수를 배제한 통합 리더보드 공개
LLM 게이트웨이 서비스를 운영하는 CONTINUUM AI의 OrcaRouter가 모델 순위를 하나의 합산 점수로 표시하는 통합 리더보드를 새롭게 선보였습니다. 이 리더보드의 가장 큰 특징은 "벤더가 제출한 점수나 유료 배치는 반영하지 않는다"는 원칙을 전면에 내세웠다는 점입니다. 최근 AI 모델 벤치마크 결과를 두고 벤더가 유리한 지표만 골라 홍보하거나, 유료 프로모션이 순위에 영향을 준다는 의혹이 꾸준히 제기되어 온 상황에서, 이런 요소를 원천적으로 배제하겠다는 선언인 셈입니다.
OrcaRouter의 합산 점수는 서로 출처가 다른 네 가지 증거를 고정된 공개 가중치로 합산해 산출됩니다. 비중이 가장 큰 것은 인간 선호도 평가로 전체의 40%를 차지하며, 이는 LMArena의 커뮤니티 블라인드 투표 결과를 반영합니다. 그다음은 30%를 차지하는 독립 벤치마크 점수로, Artificial Analysis의 지능 지수와 코딩·수학 테스트, 그리고 소프트웨어 엔지니어링 능력을 평가하는 SWE-bench Verified 결과가 포함됩니다. 나머지는 OrcaRouter가 자체적으로 수집한 운영 증거(블라인드 대결 승률과 텔레메트리 데이터)가 20%, 실제 생태계에서의 채택도를 보여주는 OpenRouter 토큰 점유율이 10%를 차지합니다.
OrcaRouter 측은 "가중치는 고정돼 있고 공개돼 있으며, 편집 조정도 유료 배치도 없다"고 밝히며 투명성을 강조했습니다. 전체 순위 데이터는 JSON, CSV, API, RSS 등 다양한 형식으로 공개되어, 누구나 원본 데이터를 검증하거나 자신만의 분석에 활용할 수 있도록 열어두었습니다. 모델 성능을 둘러싼 정보 비대칭이 커지는 가운데, 제3자가 검증 가능한 방식으로 순위를 매기려는 시도라는 점에서 주목할 만합니다.
원문: 점수는 스스로 매기지 않는다… OrcaRouter, 통합 리더보드 운영 (뉴스와이어)
4. OpenAI, 수학·AI 자문그룹 출범 — 100개 이상의 난제 해결 성과에 대응
OpenAI가 프린스턴 고등연구소(Institute for Advanced Study)에 자리한 독립 기구 'Advisory Group on Mathematics and Artificial Intelligence'와 협력 체계를 갖췄다고 발표했습니다. 이 자문그룹의 역할은 OpenAI의 AI가 내놓는 새로운 수학적 성과를 검토하고 공표하는 방식을 자문하는 것입니다. 구체적으로는 새로운 결과의 학술적 중요성을 평가하고, 그 결과를 어떻게 조율해 공개할지 조언하며, 수학 연구의 학술적·직업적 기준에 부합하는지 살피는 역할을 맡습니다. 더 나아가 AI 도구가 수학 연구와 교육을 어떻게 지원할 수 있을지에 대해서도 자문할 예정입니다.
이 자문그룹이 출범한 배경에는 OpenAI 내부 모델이 수학 전 분야에 걸쳐 100개 이상의 오랜 미해결 문제를 풀어낸 것으로 알려진 성과가 있습니다. AI가 실제 학술적 난제를 잇달아 해결하는 상황이 되자, 그 결과를 누가 어떻게 검증하고 공표할 것인가라는 새로운 문제가 떠오른 것입니다. 자문그룹은 이런 성과의 신뢰성과 공표 절차에 대한 외부의 시선을 제공하는 완충 장치 역할을 하게 됩니다.
주목할 점은 이 그룹이 OpenAI로부터 독립적으로 운영된다는 사실입니다. 구성원들은 무보수로 활동하지만, 그 대신 자유롭게 의견을 개진하고 필요하면 공개적으로 입장을 밝힐 수 있으며, 그룹 구성원 자체도 스스로 결정할 수 있는 권한을 갖습니다. 이는 OpenAI에 대한 최소한의 독립성을 확보하기 위한 구조입니다. 다만 이 독립성에는 명확한 한계도 설정되어 있습니다. OpenAI는 블로그를 통해 "그룹은 내부 수학 연구의 속도에 대해 조언할 책임을 지지 않는다"고 밝혀, 자문그룹이 OpenAI의 연구 속도를 늦추거나 방향을 바꾸도록 개입할 권한까지는 갖지 않는다는 점을 분명히 했습니다.
결국 이 자문그룹은 AI가 만들어내는 수학적 성과의 '품질 검증'과 '공표 절차'에 집중하는 기구이지, AI 연구 자체의 속도나 방향을 통제하는 거버넌스 기구는 아닌 셈입니다. AI가 순수 학문의 영역까지 실질적 성과를 내기 시작하면서, 그 성과를 다루는 절차 자체를 제도화하려는 첫걸음으로 볼 수 있습니다.
원문: Advisory Group on Mathematics and Artificial Intelligence (OpenAI)
5. Higgsfield AI, GPT-6 Astra로 영상 제작 기능을 단 하루 만에 출시
영상 생성 플랫폼 Higgsfield AI가 OpenAI의 GPT-6 Astra를 활용해 새로운 영상 제작 기능을 단 하루 만에 선보였다는 사례가 공개됐습니다. 핵심은 GPT-6 Astra가 가진 코딩·추론·복합 지식 작업 능력과 Higgsfield의 실시간 3D·영상 생성 능력을 결합했다는 점입니다. 역할 분담 구조가 명확한데, Astra가 전체적인 기획과 판단을 맡고 실제 렌더링은 Higgsfield가 수행하는 방식입니다.
Higgsfield 플러그인은 Seedance, Kling, Nano Banana Pro, GPT Image 2 등 여러 영상·이미지 생성 엔진을 채팅 인터페이스 안에서 곧바로 호출할 수 있게 해줍니다. 사용자는 별도의 영상 편집 툴을 오가지 않고도 대화창 안에서 기획부터 소재 생성까지 이어갈 수 있습니다. OpenAI는 이 조합의 목적을 소규모 기업들이 영상 광고를 더 쉽고 빠르게 만들 수 있도록 돕는 데 두고 있다고 공식적으로 설명했습니다.
실제 시연 사례도 이 조합의 잠재력을 보여줍니다. 한 창작자가 단 하나의 프롬프트만으로 Astra에게 유튜브 영상 제작을 맡기자, Astra는 관련 자료를 조사하고 대본을 작성한 뒤, 복제된 음성으로 내레이션을 생성하고 AI 아바타를 구동했습니다. 이어 음악과 효과음의 타이밍까지 맞춰 영상을 편집하고 최종 파일로 렌더링하는 전 과정을 자동으로 수행했습니다. 이 작업에 걸린 시간은 약 50분, 소요된 API 비용은 약 60달러 수준으로 알려졌습니다. 기존에는 기획, 촬영, 편집, 더빙 등 여러 단계에 걸쳐 여러 사람의 손을 거쳐야 했던 작업이, 한 번의 프롬프트와 한 시간 이내의 시간, 그리고 소액의 비용으로 압축된 셈입니다.
원문: Higgsfield AI ships new video features in a day with GPT-6 Astra (OpenAI)
6. OpenAI, "차세대 AI를 위한 표준을 만들자" — 국제 규범 마련 촉구
OpenAI가 프런티어 AI 개발을 규율할 국제 기술 표준 마련을 촉구하는 정책 입장을 발표했습니다. 이 제안의 배경에는 AI 시스템이 점점 더 자율적으로 연구를 수행하고, 나아가 스스로를 개선하는 재귀적 자기개선(RSI, Recursive Self-Improvement) 능력을 갖추게 될 가능성이 있습니다. 이런 전환이 통제 밖에서 이루어질 경우의 위험을 미리 규범화해 관리하자는 취지입니다.
OpenAI는 미국이 이 국제 표준 제정 작업을 주도해야 한다고 주장하면서, 그 수단으로 각국의 AI 안전연구소, 미국의 AI 표준·혁신 센터(CAISI, Center for AI Standards and Innovation), 국제표준화기구(ISO), 그리고 Frontier Model Forum 같은 산업 협의체를 활용할 것을 제안했습니다. 제안된 표준이 다루어야 할 범위로는 RSI와 관련된 기술적 진전을 평가하는 방법, 특정 상황에서 인간이 개입해야 하는 기준선(oversight triggers), 그리고 정렬(alignment) 문제가 발생했을 때 이를 분류하고 보고하는 체계 등이 제시됐습니다. 다만 OpenAI는 이 표준이 사업 허가(license)나 의무적인 사전 승인 절차로 기능해서는 안 된다는 점도 명시적으로 밝혔습니다. 규범은 필요하지만, 그것이 혁신을 가로막는 인허가 장벽이 되어서는 안 된다는 균형점을 잡으려는 것으로 보입니다.
OpenAI는 블로그에서 "이 전환을 안전하게 다루려면 정렬 연구가 이런 능력 발전 속도를 따라잡아야, 우리와 다른 기업이 만드는 시스템이 인간 가치에 부합하고 인간의 통제 아래 있을 수 있다"고 밝혔습니다. 또한 RSI에 대해서는 "완전 자율적인 RSI는 현재 일어나고 있지 않으며, 안전하게 수행할 수 있다는 확신이 서기 전까지는 추진해서는 안 된다"는 입장을 분명히 했습니다. AI 업계 최선두 기업 스스로가 "아직 하지 말아야 할 일"의 선을 공개적으로 그었다는 점에서, 이번 제안은 기술적 성과 발표라기보다는 업계 전체를 향한 자기 규율의 메시지에 가깝습니다.
원문: Building standards for the next phase of AI (OpenAI)
오늘의 흐름을 정리하면
오늘 검증된 소식들을 관통하는 키워드는 '경계 설정'입니다. Anthropic은 생명과학이라는 민감한 영역에서 AI의 접근 권한을 넓히되 재심사 주기와 모니터링으로 경계를 그었고, 동시에 자사 연구에서 Claude가 맡는 역할의 한계(완전 자율 아님)를 스스로 명시했습니다. OrcaRouter는 모델 성능 평가라는 영역에서 벤더의 개입을 차단하는 경계를 세웠고, OpenAI는 수학 연구 성과의 검증 절차, 영상 제작의 자동화 범위, 그리고 AI 자기개선 자체에 대한 국제적 규범이라는 세 가지 서로 다른 층위에서 각각 경계를 제안했습니다. AI의 능력이 빠르게 확장되는 만큼, 그 능력을 어디까지 어떻게 쓸 것인가에 대한 논의도 같은 속도로 진행되고 있다는 것을 보여주는 하루였습니다.
댓글 0
아직 댓글이 없습니다.