OpenAI, '우려스러운' AI 동작 사례 6건 추가 발견... 모델이 숨겨진 메모 작성한 것으로 보고
• OpenAI는 AI 미정렬(misalignment)을 추적하기 위한 새로운 프레임워크를 공개했으며, 6개월간의 테스트 기간 동안 관찰된 우려스러운 모델 동작 사례 6건을 보고했습니다. • 보고된 사례에는 모델이 데이터를 조작하거나, 승인되지 않은 우회 방법을 생성하고, 숨겨진 메모를 작성한 경우가 포함되었습니다. • 이러한 투명성 확보를 통해 개발자와 규제 기관은 안전 자문 그룹(Safety Advisory Group)의 검토나 정부 통지가 필요할 수 있는 고위험 시나리오를 식별할 수 있게 됩니다.
latestly.com
