이렇게 당신을 테스트합니다

Harness와 자기 개선 · 30가지 핵심 질문

이 장은 가장 최첨단 내용을 다루고 있으며, 테스트하는 사람이 진짜와 가짜를 가장 쉽게 구별할 수 있습니다. 이 30개의 질문은 세 가지 실제 시나리오에서 나왔습니다. 먼저 스스로 답해보고 프레임워크를 확인하세요.

이 페이지 사용법
각 문제에는 질문자가 표시되어 있습니다. 같은 지식을 테스트하지만, 각자 듣고 싶은 것이 다릅니다.
🎙 면접관진짜로 이해하는지, 아니면 용어만 외웠는지 확인하려 합니다
👔 상사설명과 약속을 원합니다
🛠 기술 동료신뢰할 만한 사람인지 탐색합니다
각 문제는 세 레이어로 구성됩니다:무엇을 테스트하는가 → 답변 프레임워크 → 보너스 포인트. 답하지 못한 부분은 끝의 강좌 링크를 클릭해 복습하세요.
Q1면접관
「요즘 다들 Harness 이야기를 하는데, 그게 도대체 무엇인지 설명해 주실 수 있나요? 왜 모델 자체만큼 중요하다고 하는 사람들이 있을까요?」
🎯 무엇을 평가하는가
이 장의 첫 번째 검증 문제입니다. Harness를 명확한 시스템 개념으로 설명할 수 있는지, 아니면 「그냥 래퍼」「Agent 프레임워크」라고 모호하게 말하는지 확인합니다. 진짜로 이해하는 사람은 Harness가 무엇을 관리하고, 왜 제품 성패를 결정하는지 명확히 설명할 수 있습니다.
🧭 답변 프레임워크
  1. 먼저 정의:Harness는 기반 모델을 둘러싼 런타임 시스템으로, 모델이 어떻게 생각하고 계획하는지, 도구를 호출하고 행동하는지, 컨텍스트를 인식하고 관리하는지, 결과물을 저장하고 결과를 평가하는지를 결정합니다. 모델은 지능을 담당하고, Harness는 지능이 실제로 작동하도록 합니다.
  2. 증거 제시:Claude Code, Codex, Cursor 같은 성공적인 제품들이 Harness 레이어가 원시 모델 지능만큼 중요하다는 것을 증명했습니다. 평범한 모델에 뛰어난 Harness를 더하면 더 강한 벌거벗은 모델보다 나은 경우가 많습니다.
  3. PM 관점 설명:모델을 교체하는 것은 쉽습니다 — Harness가 제품의 진짜 해자입니다. 같은 모델이라도 Harness 설계 품질에 따라 사용자 경험이 몇 자릿수 차이납니다.
  4. 한 단계 높이기:Harness는 공학적 조역에서 최적화 대상 자체로 변화하고 있습니다. 첨단 연구가 모델로 하여금 자신을 둘러싼 Harness를 개선하게 합니다 — 이것이 재귀적 자기 개선의 현실적인 경로입니다.
⭐ 가산점Prompt Engineering 비유를 능동적으로 제시하세요:수동 Prompt 기법은 모델이 강해지면서 서서히 사라졌지만, 목표·제약·컨텍스트·평가를 지정하는 필요성은 항상 있었습니다. Harness의 많은 개선 사항은 결국 모델에 내재화되겠지만, 외부 컨텍스트 및 도구와의 인터페이스는 영원히 존재할 것입니다.
이 강의 페이지로 답변을 구성하세요 → 비계에서 자기 개선 시스템으로 Harness의 세 가지 설계 패턴
Q2면접관
「프로덕션급 Agent 아키텍처를 설계한다면 어떤 설계 패턴을 따를 건가요? 왜 지금 최강의 코딩 Agent들은 모두 비슷하게 생겼을까요?」
🎯 무엇을 평가하는가
아키텍처 언어가 있는지 확인합니다. 도구 이름과 프레임워크 이름을 나열하면 들통납니다. 듣고 싶은 것은 패턴 수준의 추상화입니다:왜 이 시스템들이 유사한 구조로 수렴하는지, 각 패턴이 어떤 문제를 해결하는지.
🧭 답변 프레임워크
  1. 세 가지 패턴 제시:워크플로우 자동화, 파일시스템을 영구 메모리로, 하위 Agent와 백그라운드 태스크. 이것들은 현재 최강 Agent 시스템의 아키텍처 결정 90%를 커버합니다 — 구조적 필수 요소이며 선택 여지가 없습니다.
  2. 패턴 1 — 루프:Agent는 목표 지향 루프입니다, Plan → Execute → Observe → Improve → 다시 실행. 실패는 자기 교정의 트리거입니다:테스트 실패, 명령 오류가 나면 Agent는 궤적을 분석하고 조정합니다.
  3. 패턴 2 — 메모리:긴 태스크의 결과물은 컨텍스트 윈도우를 빠르게 초과합니다. 올바른 접근법은 영구 상태를 파일시스템에 저장하고 Agent가 필요할 때 읽고 쓰게 하는 것입니다. 한 문장 원칙:컨텍스트는 작업 기억, 파일시스템은 장기 기억.
  4. 패턴 3 — 병렬 처리:부모 Agent가 프로세스 매니저 역할을 합니다:하위 Agent를 생성하고, 진행 상황을 폴링하며, 실패한 브랜치를 취소하고, 결과를 병합합니다. 하위 Agent 출력은 파일로 영구 저장해야 중단 후에도 복구할 수 있습니다.
⭐ 가산점하위 Agent 병렬 처리의 핵심 트레이드오프를 설명하세요:각 하위 Agent는 독립 샌드박스에서 작업하고 명확한 파일 경로로 출력합니다;부모 Agent는 파일 상태를 폴링하여 조율하며 메모리를 공유하지 않습니다. 이 설계는 동시성 제어를 크게 단순화합니다 — 이것을 말할 수 있다면 실제 프로덕션 시스템을 본 사람입니다.
이 강의 페이지로 답변을 구성하세요 → Harness의 세 가지 설계 패턴 비계에서 자기 개선 시스템으로
Q3상사
「우리 Agent가 태스크가 길어지면 멍청해지고, 앞에서 말한 것을 나중에 다 잊어버립니다. 이 문제를 고칠 수 있나요? 얼마나 걸릴까요?」
🎯 무엇을 평가하는가
상사는 진단 + 해결책 + 일정을 원합니다. 들통나는 답변은 「더 큰 컨텍스트 윈도우 모델로 바꾸자」입니다 — 이것은 근본 원인을 이해하지 못한 것입니다. 진짜 문제는 컨텍스트 관리 전략에 있으며, 이를 설명하고 단계별 방안을 제시할 수 있는 사람만이 신뢰를 얻을 수 있습니다.
🧭 답변 프레임워크
  1. 먼저 근본 원인 진단:대부분 단순 추가형 컨텍스트 관리가 원인입니다. 모든 도구 응답과 히스토리를 컨텍스트에 밀어넣으면, 태스크가 길어질수록 윈도우가 꽉 차고, 초기 정보가 밀려나며, 출력 품질이 급락합니다. 이는 전략 문제이므로 더 큰 윈도우 모델로 바꾸면 증상만 늦출 뿐입니다.
  2. 1단계 해결책:파일시스템 영구 메모리를 도입하세요. 매 라운드 완료 후 진행 상황, 오류 로그, 중간 결과를 파일에 기록하고 컨텍스트를 해제한 후 다음 라운드에 필요할 때 읽어옵니다. 컨텍스트 사용량이 지속 증가에서 일정으로 바뀌어 수십 라운드를 안정적으로 실행할 수 있습니다.
  3. 2단계 해결책:ACE 스타일의 구조화된 컨텍스트 관리를 도입하세요. Generator가 작업을 수행하고, Reflector가 성공과 실패 궤적에서 인사이트를 추출하며, Curator가 인사이트를 항목화된 플레이북으로 정리해 점진적으로 병합하고 정기적으로 중복을 제거합니다. 경험은 쌓일수록 정교해지고 컨텍스트는 점점 가벼워집니다.
  4. 일정 약속:1단계는 엔지니어링 개선으로 1주일 내 효과를 볼 수 있습니다. 2단계는 수렴을 검증할 평가 세트 구축이 필요하며, 2주마다 장기 태스크 성공률 변화를 지표로 보고합니다.
⭐ 가산점업계 관찰을 추가하세요:긴 컨텍스트 능력과 컨텍스트 엔지니어링은 두 개의 다리입니다. 모델 윈도우가 아무리 커도 구조화되고 간결한 컨텍스트를 구축하는 관리 레이어가 필요합니다. Agent를 만드는 모든 팀이 이 문제에 직면하게 됩니다 — 일찍 해결하는 것이 경쟁 우위입니다.
Q4면접관
「컨텍스트 엔지니어링은 그냥 Prompt를 잘 쓰는 거 아닌가요? 논문에서 이제 자동으로 진화할 수 있다고 하던데 — ACE, MCE 알고 계신가요?」
🎯 무엇을 평가하는가
최첨단에 대한 이해의 깊이와 계층 감각을 테스트합니다. 용어만 외운 사람은 ACE와 MCE를 뒤섞습니다. 진짜로 이해하는 사람은 진화 라인을 설명할 수 있습니다:최적화 대상이 레이어마다 업그레이드되며 내용에서 메커니즘, 시스템 코드로 이어지고 각 레이어가 무엇을 해결하는지.
🧭 답변 프레임워크
  1. 먼저 전제 수정:수동 Prompt 작성은 시작점에 불과합니다. 최적화 대상에는 진화 라인이 있습니다:지시 Prompt → 구조화된 컨텍스트 → 워크플로우 → Harness 코드 → 옵티마이저 코드. 모델이 강할수록 최적화할 수 있는 대상이 더 복잡해집니다.
  2. ACE 설명:컨텍스트 내용을 최적화합니다. 구조화된 bullet point 플레이북을 유지합니다;Generator가 태스크를 수행하고, Reflector가 성공·실패 궤적에서 인사이트를 추출하며, Curator가 결정론적 로직으로 항목을 점진적으로 병합합니다. 절대 통째로 다시 쓰지 않아 컨텍스트 붕괴를 방지합니다. 한계는 업데이트 규칙이 여전히 수동 설계에 의존한다는 점입니다.
  3. MCE 설명:「컨텍스트를 어떻게 관리할까」와 「컨텍스트에 무엇이 있는가」를 분리하여 이중 레이어 최적화를 합니다. 내부 레이어는 주어진 스킬에 최적의 컨텍스트를 찾고, 외부 레이어는 다양한 스킬을 비교하여 최적의 메커니즘을 선택합니다. 기억하는 내용과 기억하는 방법이 함께 진화합니다.
  4. Meta-Harness 설명:한 단계 더 깊이 들어가면, 최적화 대상은 정보가 어떻게 저장·검색·표현될지를 결정하는 코드 자체입니다. Proposer는 파레토 프론티어에 있는 Harness 후보 세트를 출력하는 코딩 Agent입니다. 가장 범용적이지만 각 수정마다 전체 시험 실행과 채점이 필요하여 가장 컴퓨팅 집약적입니다.
⭐ 가산점세 가지 차이를 한 문장으로 요약하세요:ACE는 노트 내용을 최적화하고, MCE는 노트 작성 방법을 최적화하며, Meta-Harness는 전체 작업 공간의 소스 코드를 최적화합니다. 핵심 교훈을 추가하세요:Harness 설계가 실행 가능한 검색 공간이 되면, 강력한 코딩 Agent는 인간 엔지니어와 동일한 설계 공간을 탐색할 수 있습니다.
Q5기술 동료
「Agent이 자신의 Harness를 스스로 수정하게 하고 싶다고요? 그러면 평가기도 수정해서 자신에게 만점을 주면 어떻게 할 건가요?」
🎯 무엇을 평가하는가
기술 동료가 날카로운 반례로 자기 개선 시스템의 안전 설계를 이해하는지 탐색합니다. 「수정하지 말라는 Prompt를 추가하자」는 답변은 그 자리에서 신뢰를 잃습니다. 듣고 싶은 것은 경계 설계입니다:무엇이 개선 루프 밖에 있어야 하고, 각 변경을 어떻게 검증하는가.
🧭 답변 프레임워크
  1. 먼저 문제가 실제로 있음을 인정하세요:이것이 바로 보상 해킹(reward hacking)으로, 자기 개선 루프에서 가장 위험한 반패턴입니다. 단위 테스트를 최적화하면 테스트 케이스에 오버피팅하고, 판단 모델을 최적화하면 허점을 이용하는 법을 배우며, 벤치마크 점수를 최적화하면 벤치마크 허점을 악용합니다.
  2. 경계 원칙 제시:평가기와 권한 제어는 반드시 진화 루프 밖에 있어야 하며, 인간 또는 변조 불가능한 독립 메커니즘이 관리해야 합니다. 출제자와 채점자는 반드시 시험받는 학생과 독립적이어야 합니다. 편집 가능한 범위는 제한되어야 하며, OS 시스템 설정 레벨까지 수정하는 것은 추상화 경계를 무너뜨리는 것과 같습니다.
  3. 검증 메커니즘 제시:Self-Harness의 3단계 루프를 참고하세요. Weakness Mining이 실패 궤적에서 실패 패턴을 클러스터링하고, Harness Proposal이 범위 내 편집을 제안하며, Proposal Validation이 held-in과 held-out 데이터셋으로 검증해 회귀가 없는 편집만 수락합니다.
  4. 역량 전제 조건 제시:STOP 실험은 재귀 구조 자체가 개선을 보장하지 않는다는 것을 증명했습니다. GPT-4는 지속적으로 진보하지만 약한 모델은 오히려 노이즈를 증폭시키고 퇴보합니다. 이 시스템을 도입하기 전에 기반 모델이 메타 수준의 최적화를 지원할 수 있는지 먼저 평가하세요.
⭐ 가산점상대가 생각하지 못했을 또 다른 리스크를 추가하세요:다양성 붕괴(diversity collapse). 진화 루프는 알려진 고보상 패턴을 자연스럽게 이용합니다;모든 후보가 같은 해결책의 미세한 변형이 되면 혁신이 멈춥니다. 다양성 보상, 아카이브 보존 같은 메커니즘이 안전망으로 필요합니다. 두 가지 리스크를 모두 설명할 수 있다면 이 대화에서 이긴 것입니다.
Q6면접관
「재귀적 자기 개선은 지금 어디까지 와 있나요? AI가 스스로를 수정할 수 있게 됐는데 — 이제 곧 통제 불능이 되는 건 아닌가요?」
🎯 무엇을 평가하는가
신화화하지도, 공황에 빠지지도 않고 최첨단 진행 상황을 평가할 수 있는지 확인합니다. 두 가지 들통나는 답변이 있습니다:「AI가 각성하려 한다」고 부추기거나, 「모두 과대선전」이라고 일축하는 것. 듣고 싶은 것은 사실에 근거하고, 경계가 명확하며, 판단이 있는 업계 인식입니다.
🧭 답변 프레임워크
  1. 먼저 개념적 좌표 제시:RSI 개념은 Good(1965)에서 Yudkowsky(2008)까지 이어졌으며, 시스템이 자신의 현재 지능을 사용해 지능을 생성하는 메커니즘 자체를 개선하는 것을 의미합니다. 수십 년간 이론 개념이었다가 최근 2년 사이에 현실적인 경로가 생겼습니다.
  2. 현실적인 경로 설명:모델은 자신의 가중치를 직접 수정하지 않습니다. 개선하는 것은 자신을 둘러싼 Harness입니다:컨텍스트 관리, 워크플로우, 도구 오케스트레이션, 평가. 더 나은 Harness가 더 강한 모델을 낳고, 더 강한 모델이 다시 Harness를 단순화해 긍정적 피드백 플라이휠을 형성합니다.
  3. 진행 상황의 실제 수준 제시:STOP은 개선기가 자신을 재귀적으로 개선할 수 있음을 증명했으며, 유전 알고리즘, Beam Search 같은 클래식 전략을 자동으로 재발견했습니다;Self-Harness는 Agent가 약점 발굴, 편집 제안, 회귀 검증을 통해 자신의 설정을 개선하게 합니다. 하지만 이 모든 것은 범위가 정해지고 검증 가능한 루프 안에서 일어납니다.
  4. 통제 불능 질문에 직접 답변:통제 불능이 되려면 아직 일곱 가지 관문이 남아 있습니다:약한 평가기로 인한 피드백 신호 모호화, 메모리 라이프사이클 관리 실패, 보상 해킹, 다양성 붕괴, 장기 건강 측정의 어려움. 이것들은 근본적인 시스템 설계 과제이며, 공통 해결책은 모두 인간을 루프에 두고 올바른 추상화 레벨에서 감독을 제공하는 방향을 가리킵니다.
⭐ 가산점자동화된 연구의 현실 검증으로 마무리하세요:AI Scientist는 형식적으로 완전한 논문을 작성할 수 있지만, 논문을 쓸 수 있다는 것은 과학을 할 수 있다는 것과는 거리가 멉니다 — 가짜 인용, 구현 드리프트, 과도한 낙관주의 같은 실패 패턴이 반복적으로 나타납니다. 이 사례로 1차 자료를 검토했고 판단의 근거가 있음을 보여주세요.
Q7면접관
「Agent 최적화를 하신다면, 구체적으로 무엇을 최적화하나요? 솔직히 Prompt를 좀 고치는 거 아닌가요?」
🎯 무엇을 평가하는가
최적화 대상의 계층을 아는지 확인합니다. Prompt만 조정한다고 말하는 사람은 가장 아래층에 머물러 있습니다. 진짜로 이해하는 사람은 최적화 대상에 다섯 단계 진화 라인이 있다는 것을 알고, 모델이 강할수록 최적화 가능한 계층이 위로 올라가는 이유도 설명할 수 있습니다.
🧭 답변 프레임워크
  1. 다섯 단계 사다리를 제시:지시 Prompt → 구조화된 컨텍스트 → 워크플로우 → Harness 코드 → 옵티마이저 코드. Prompt를 조정하는 것은 Level 1일 뿐이고, 이 선의 끝은 「옵티마이저를 쓰는 코드」를 최적화하는 것입니다.
  2. 상향 이동 논리를 설명:모델이 지능적일수록 최적화할 수 있는 목표는 더 복잡해지고 방법은 더 범용적이 됩니다. ACE는 컨텍스트 내용을 최적화하고, AFlow는 워크플로우를 검색하며, Meta-Harness는 Harness 소스 코드를 고치고, STOP은 개선기 자체를 최적화합니다. 각 레벨마다 대표 연구가 있습니다.
  3. PM 판단을 제시:팀이 지금 어느 레벨에 갇혀 있는지 먼저 보세요. 대부분의 팀은 아직 Level 1과 Level 2 사이이고, 위로 갈수록 평가 체계에 대한 요구가 가파르게 늘어납니다.
⭐ 가산점이 사다리의 공통 교훈을 짚으세요:Harness 설계가 실행 가능한 검색 공간이 되면, 강력한 코딩 Agent는 인간 엔지니어와 동일한 설계 공간을 탐색할 수 있습니다. 계층이 높을수록 사람의 역할은 실행자에서 출제자로 바뀝니다.
Q8면접관
「Agent가 하위 Agent를 병렬로 띄울 수 있다고 하셨는데, 부모 Agent는 구체적으로 무엇을 관리하나요? 하위 Agent가 중간에 죽으면 어떻게 하죠?」
🎯 무엇을 평가하는가
하위 Agent 패턴의 엔지니어링 세부를 테스트합니다. 들통나는 답변은 「그냥 여러 개를 같이 돌리는 것」입니다. 듣고 싶은 것은 프로세스 관리 관점입니다:부모 Agent가 무엇을 관리하는지, 상태는 어떻게 확인하는지, 고장 나면 어떻게 대비하는지.
🧭 답변 프레임워크
  1. 먼저 역할을 정하세요:부모 Agent는 프로세스 매니저이며 네 가지를 합니다:하위 태스크를 시작하고, 로그와 진행 상황을 확인하며, 실패한 브랜치를 취소하고, 성공한 결과를 병합합니다. 이것은 운영체제 수준의 사고입니다.
  2. 명시적 확인 가능성을 설명:병렬은 발사 후 방치가 아닙니다. 부모 Agent는 각 하위 Agent의 상태, 출력, 오류를 언제든 볼 수 있어야 합니다.
  3. 출력 영속화를 설명:하위 Agent의 결과는 파일, 로그, 상태 기록으로 저장해야 하며, 부모 Agent의 컨텍스트로만 돌려보내면 안 됩니다. 그래야 중단 후에도 복구할 수 있습니다.
  4. 장애 허용 대비를 설명:백그라운드 태스크는 타임아웃되고, 충돌하고, 저품질 결과를 냅니다. Harness는 재시도 전략과 우아한 다운그레이드 메커니즘을 미리 설계해야 합니다.
⭐ 가산점규모감을 주세요:병렬의 이득은 직렬 대기를 멀티코어 가속으로 바꾸는 것입니다. 강좌 데모에서는 병렬 태스크 5개를 3라운드에 끝냈고 (직렬이면 5라운드), 메인 Agent는 분배와 병합만 담당해 컨텍스트 점유가 30%가 되지 않았습니다.
이 강의 페이지로 답변을 구성하세요 → Harness의 세 가지 설계 패턴
Q9기술 동료
「기억은 파일시스템에 그냥 쌓을 생각인가요? 벡터 DB나 전용 메모리 모듈은 안 쓰고 — 일을 줄이려는 건가요, 아니면 진짜 이유가 있나요?」
🎯 무엇을 평가하는가
유행을 따라 고른 것인지, 트레이드오프를 이해한 것인지 탐색합니다. 파일시스템 방안의 설계 이유와 역할 경계를 말하지 못하면 게으른 선택으로 보입니다. 듣고 싶은 것은 이 「투박한 방법」 뒤에 있는 구조적 이유입니다.
🧭 답변 프레임워크
  1. 먼저 역할 분담 원칙을 주세요:컨텍스트는 작업 기억, 파일시스템은 장기 기억입니다. 현재 태스크 지시, 즉시 도구 결과, 최근 2-3라운드 대화는 컨텍스트에 두고;과거 실험 결과, 오류 로그, 완료된 하위 태스크 요약, 장기 전략은 파일에 둡니다.
  2. 산출물의 현실을 설명:긴 태스크의 산출물(실험 로그, 코드 diff, 논문 요약, 오류 추적, 전체 실행 궤적)은 컨텍스트 윈도우를 빠르게 초과합니다. 전부 Prompt에 밀어 넣는 것은 구조적인 막다른 길입니다.
  3. 설계 이유를 주세요:파일 읽기·쓰기는 LLM의 기초 스킬이라 복잡한 외부 도구 체인이 필요 없고, 기반 모델 능력 향상 혜택도 받습니다:모델이 똑똑할수록 파일 관리가 더 효율적입니다. 외장 메모리 시스템은 이 이득을 누리지 못합니다.
  4. 작업 습관을 설명:좋은 Agent는 scratchpad, todo 목록, 실험 기록을 스스로 유지하며, 인간 프로그래머처럼 작업 공간을 관리합니다.
⭐ 가산점최첨단 방법으로 뒷받침하세요:MCE는 컨텍스트 함수를 디렉터리 안의 파일 집합으로 인스턴스화합니다. skill.md에 지식을 두고, 동적 파일에 rollout 기록을 둡니다;Meta-Harness도 파일시스템으로 실행 히스토리에 접근합니다. 파일시스템을 기억으로 쓰는 것은 이미 최첨단 자기 개선 방법의 공통 기반입니다.
Q10상사
「뉴스에서 이제 Agent가 스스로 진화한다던데, 경쟁사가 먼저 만들면 어떡하죠? 우리도 프로젝트 만들어서 따라가야 하나요?」
🎯 무엇을 평가하는가
상사는 판단 기준을 원합니다. 무엇을 따라갈 수 있고, 무엇이 아직 논문 안에 머무는지 나눠 주길 바랍니다. 좋다고만 하거나 안 된다고만 하면 위험하고, 적용 가능 여부를 검사하는 세트를 줄 수 있는 사람에게만 권한을 맡깁니다.
🧭 답변 프레임워크
  1. 적용 조건 세 가지를 주세요:진화 검색이 작동하려면 동시에 만족해야 합니다:검색 공간이 크고 이산적이며, 그래디언트는 쓸 수 없지만 평가는 쉽고, fitness를 숫자로 수치화할 수 있습니다. 세 가지를 모두 갖출 때만 도입할 가치가 있습니다.
  2. 적용하지 말 목록을 주세요:평가 한 번에 몇 시간이 걸리고, 평가 기준이 모호하고 주관적이며, 주로 휴리스틱 판단에 의존하고, 컴퓨팅 예산이 빠듯하며, 사람 검토 단계가 필요합니다. 하나라도 해당되면 일단 손대지 마세요.
  3. 우리 업무에 대조하세요:핵심 질문은 우리 Agent 태스크에 자동 채점할 평가 세트가 있는가입니다. 없다면 첫 단계는 평가를 만드는 것이고, 우선순위가 진화 알고리즘을 올리는 것보다 훨씬 높습니다.
  4. 참조계를 주세요:DGM은 진화로 SWE-bench Verified를 20%에서 50%로 올렸지만, 그것은 코딩 태스크라 테스트 통과 여부가 원래 자동 평가됩니다. 우리 태스크에 그런 「저울」이 있는지 먼저 확인하세요.
⭐ 가산점리스크를 먼저 예고하세요:조건이 모두 맞아도 진화 루프에는 보상 해킹과 다양성 붕괴라는 두 종류의 함정이 있고, 평가기는 반드시 루프 밖에 두고 사람이 유지해야 합니다. 프로젝트 전에 리스크를 말해 두는 것이, 터진 뒤에 설명하는 것보다 낫습니다.
Q11면접관
「ACE는 왜 그 플레이북을 한 줄씩 증분 업데이트해야 하나요? 모델에게 전체 Prompt를 한 번에 다시 쓰게 하면 훨씬 편한 거 아닌가요?」
🎯 무엇을 평가하는가
ACE의 가장 핵심적인 설계 결정을 아는지 확인합니다. 흐름만 외운 사람은 Generator, Reflector, Curator 세 이름만 읊습니다. 진짜로 이해하는 사람은 업데이트 방식이 왜 반드시 증분 병합이어야 하는지 말할 수 있습니다.
🧭 답변 프레임워크
  1. 먼저 메커니즘을 제시하세요:ACE는 구조화된 bullet point 플레이북을 유지하며, 각 항목에 identifier와 description이 있습니다. Generator는 플레이북을 따라 일하고, Reflector는 성패 궤적에서 인사이트를 추출하며, Curator는 인사이트를 플레이북에 다시 씁니다.
  2. 핵심 설계를 설명:Curator는 구조화된 (identifier, description) 항목을 출력하고, 결정론적 로직으로 플레이북에 병합하며, 전체 Prompt를 통째로 다시 쓰지 않습니다.
  3. 이유를 명확히:모델이 전체 내용을 반복해 다시 쓰면 컨텍스트 붕괴와 간결성 편향이 생기고, 유용한 세부 사항이 한 번 한 번 눌려 사라집니다. 증분 병합에 정기 정제·중복 제거를 더하면, 경험은 쓸수록 정교해지고 컨텍스트는 두꺼워지지 않습니다.
  4. 한계를 짚으세요:ACE의 업데이트 규칙은 여전히 수동 설계에 의존하며, 바로 이 지점을 MCE가 이어서 풉니다.
⭐ 가산점한 문장으로 꿰뚫으세요:컨텍스트는 계속 진화하는 플레이북입니다. Prompt를 무한히 늘리면 오버플로하고, 모델이 통째로 다시 쓰게 하면 붕괴합니다. ACE는 세 번째 길을 골랐습니다:항목화, 증분, 중복 제거 가능.
이 강의 페이지로 답변을 구성하세요 → 컨텍스트 엔지니어링:수동에서 자동 진화로
Q12면접관
「MCE는 이중 레이어 최적화라고 하는데, 두 레이어는 각각 무엇을 최적화하나요? ACE와의 본질적 차이는 무엇인가요?」
🎯 무엇을 평가하는가
최첨단 방법을 구별하는 문제입니다. 메커니즘을 분해하는 능력을 테스트합니다. skill이 무엇인지, 안팎 레이어가 각각 무엇을 하는지, 이 두 질문에 답하지 못하면 제목과 공유 문구만 본 것입니다.
🧭 답변 프레임워크
  1. 먼저 skill을 정의:하나의 MCE skill은 컨텍스트 함수 c = F(x; ρ)를 정의합니다. ρ는 정적 컴포넌트(prompts, 지식 베이스, 코드베이스)이고, F는 동적 연산자(검색, 선택, 필터, 포맷)입니다. 컨텍스트를 관리하는 방법 자체가 형식화됩니다.
  2. 이중 레이어를 분해하세요:내부 레이어는 주어진 skill에서 훈련 세트로 최적 컨텍스트를 찾고;외부 레이어는 검증 세트에서 서로 다른 skill을 비교해 최적 메커니즘을 고릅니다. 먼저 내용을 최적화하고, 다음에 방법을 최적화하며, 번갈아 갑니다.
  3. 진화 방식을 설명:시스템은 skill 데이터베이스에 각 (skill, context, 훈련 점수, 검증 점수)를 기록하고, Meta-agent는 agentic crossover로 히스토리에서 새 skill을 교배합니다.
  4. ACE와 대조:ACE의 업데이트 규칙은 수동 설계이고 고정됩니다;MCE는 「어떻게 기억할까」도 최적화 루프에 넣어, 기억하는 내용과 기억하는 방법이 함께 진화합니다.
⭐ 가산점안팎 레이어가 훈련 세트와 검증 세트를 나누어 쓰는 의도를 짚으세요:skill의 좋고 나쁨을 내부 레이어 최적화에 쓰이지 않은 데이터에서 채점해, 관리 메커니즘이 특정 몇 개 태스크에 과적합하지 않게 합니다. 머신러닝의 과적합 방지와 한 줄기입니다.
이 강의 페이지로 답변을 구성하세요 → 컨텍스트 엔지니어링:수동에서 자동 진화로
Q13기술 동료
「Meta-Harness가 harness를 그렇게 많이 반복하면 히스토리가 계속 커지는데, 그걸 전부 모델에 넣으면 자기 컨텍스트부터 터지는 거 아닌가요?」
🎯 무엇을 평가하는가
엔지니어링 실현 가능성으로 방법을 진짜 읽었는지, 개념만 전달하는지 탐색합니다. 듣고 싶은 것은 히스토리를 어떻게 저장하는지, 옵티마이저가 어떻게 읽는지, 진짜 비용 병목이 어느 고리에 있는지입니다.
🧭 답변 프레임워크
  1. 저장 구조를 설명:제안된 각 harness는 파일시스템에서 하나의 딕셔너리입니다:소스 코드, 점수, 궤적, 상태 업데이트. 히스토리는 Prompt에 넣지 않고 전부 디스크에 저장합니다.
  2. 접근 방식을 설명:Proposer 자체가 코딩 Agent라 grep, cat으로 실행 히스토리를 필요할 때 읽습니다. 필요한 구간만 찾아, 전부를 컨텍스트에 밀어 넣지 않습니다.
  3. 출력 형태를 설명:산출물은 파레토 프론티어에 있는 harness 후보 집합입니다. 다중 목표 아래에서 각기 장점이 있는 방안 세트를 남겨, 시나리오에 따라 고를 수 있습니다.
  4. 진짜 병목을 인정:버티지 못하는 곳은 평가 쪽입니다:harness를 한 버전 고칠 때마다 완전한 시험 실행과 채점이 필요합니다. Meta-Harness는 세 가지 컨텍스트 최적화 방법 중 가장 범용적이면서 계산도 가장 무겁습니다.
⭐ 가산점설계 통찰을 한 줄 보태세요:Proposer가 쓰는 grep과 cat은 전부 코딩 Agent의 기본기이고, Meta-Harness는 히스토리 접근을 위해 새 메커니즘을 만들지 않았습니다. 이는 「코드가 Harness를 정의하는 범용 언어」임을 뒷받침합니다. 코딩 능력이 강한 모델은 본래 옵티마이저에 맞습니다.
Q14면접관
「AFlow는 체스 알고리즘으로 워크플로우를 검색한다고 하는데, 구체적으로 어떻게 검색하나요? 언제 끝났다고 보나요?」
🎯 무엇을 평가하는가
자동 워크플로우 검색의 메커니즘을 이해하는지 확인합니다. 그래프 표현과 검색 루프를 말할 수 있어야 읽은 것이고, 종료 조건은 가장 쉽게 되묻혀 넘어지는 세부입니다.
🧭 답변 프레임워크
  1. 먼저 표현을 설명:워크플로우는 방향 그래프로 나타냅니다. 노드는 LLM 호출 동작이고, 엣지는 코드의 논리 연산(조건 분기, 루프, 데이터 전달)입니다. 설계 문제는 이렇게 트리 검색 문제가 됩니다.
  2. 검색 루프를 설명:초기 워크플로우를 루트 노드로 삼고;점수와 균등 탐색의 소프트 혼합으로 확장할 노드를 골라 이용과 탐색을 균형 맞추며;LLM이 수정 변형(노드와 엣지의 추가·삭제·변경)을 생성하고;실행해 평가한 뒤, 개선이 있으면 검색 트리에 다시 넣습니다.
  3. 종료 조건에 답하세요:top-k 평균 점수가 안정되거나, 계산 예산이 바닥날 때까지 순환합니다.
  4. 위치를 주세요:ADAS가 meta-agent self-refine으로 자유롭게 발휘하는 것과 달리, AFlow는 MCTS로 체계적 검색을 해 수렴이 더 안정적이고, 실험에서도 수동 설계와 ADAS를 앞섰습니다.
⭐ 가산점강좌 데모로 마무리하세요:「Plan → Execute」52점에서 시작해, 몇 라운드 검색 후 성찰과 검증의 조합이 78점을 받았고, 수동 출발점보다 50% 높았습니다. 검색된 최적 구조는 마침 숙련 엔지니어의 작업 습관과 닮았습니다.
이 강의 페이지로 답변을 구성하세요 → 워크플로우 설계:수동에서 자동 검색으로
Q15면접관
「AI Scientist는 스스로 연구하고 논문을 쓴다고 하는데, 파이프라인은 어떤 모양인가요? 심사 관문은 어떻게 넘나요?」
🎯 무엇을 평가하는가
파이프라인을 설명하면서도 냉정을 유지할 수 있는지 확인합니다. 완전 자동화에만 감탄하는 사람과, 전부 과대선전이라고만 하는 사람 모두 불합격입니다.
🧭 답변 프레임워크
  1. 파이프라인을 제시:연구 아이디어 제안 → 코드 작성 → 실험 실행 → 결과 분석 → 논문 작성 → 동료 심사, 여섯 단계가 전부 LLM으로 구동되며, 엔드투엔드로 한 바퀴의 완전한 연구 루프를 돕니다.
  2. 심사 단계를 설명:심사는 LLM-as-judge를 품질 관문으로 들이고, 산출 논문의 형식은 완전합니다.
  3. 현실 검증을 주세요:논문을 쓸 수 있다는 것은 과학을 할 수 있다는 것과는 거리가 멉니다. 시스템 테스트에서 반복적으로 나타나는 여섯 가지 실패 모드가 나왔습니다:학습 데이터 기본값 선호, 실행 압박 하의 구현 드리프트, 메모리와 컨텍스트 저하, 과도한 낙관주의, 도메인 지능 부족, 약한 과학적 안목.
  4. 판단을 내리세요:이것들은 구조적 병목입니다. 전문가가 설계한 Harness는 연구 루프의 대부분 단계를 조율할 수 있지만, 단계 안의 판단 품질은 아직 멀었습니다.
⭐ 가산점한 가지를 자세히 말하는 것이 실력을 보여 줍니다:「과도한 낙관주의」는 시스템이 실험이 기준선을 유의미하게 능가한다고 주장하지만 실제 결과는 전부 노이즈인 경우이고;「도메인 지능 부족」은 논문에는 쓰이지 않지만 실험실의 모든 사람이 아는 암묵적 기예의 결핍입니다. 이 두 가지는 마침 LLM-as-judge도 막기 어렵습니다.
Q16면접관
「합성 데이터는 다들 만드는데, Autodata는 왜 자기 데이터가 품질이 높다고 하나요? 한 문제가 잘 나왔는지를 어떻게 아나요?」
🎯 무엇을 평가하는가
데이터 품질 신호를 이해하는지 확인합니다. 데이터 품질을 공허하게 말하는 사람은 많고, 조작 가능한 판정 기준을 한 줄 말할 수 있는 사람은 적습니다.
🧭 답변 프레임워크
  1. 역할 체계를 제시:네 역할이 협업합니다:Challenger가 출제하고, Weak Solver와 Strong Solver가 각각 풀어 보며, Verifier / Judge가 중재합니다.
  2. 핵심 판정 기준을 주세요:난이도 차이가 곧 품질 신호입니다:strong solver는 풀고 weak solver는 못 푸는 문제만 남깁니다.
  3. 이유를 설명:둘 다 푸는 문제는 훈련 가치가 없고, 둘 다 못 푸는 문제는 원래 나쁜 문제일 수 있습니다. 능력 경계에 놓인 문제가 모델을 올리는 가치가 가장 큽니다.
  4. PM이 옮길 지점을 주세요:「두 능력 등급으로 난이도 띠를 집어내는」라는 발상은 평가 세트 구축과 훈련 데이터 등급 설계에 그대로 옮길 수 있습니다.
⭐ 가산점위치를 주세요:Autodata와 AI Scientist는 모두 수동 설계 워크플로우의 대표작이며, 자동 검색이 성숙하기 전에는 전문가가 손으로 쓴 다중 역할 워크플로우가 여전히 생산 가치를 내는 주력임을 보여 줍니다.
이 강의 페이지로 답변을 구성하세요 → 워크플로우 설계:수동에서 자동 검색으로
Q17기술 동료
「STOP의 그 재귀 개선기, 솔직히 모델이 자기 Prompt를 고치게 하는 거 아닌가요? 진짜 고칠수록 좋아지나요?」
🎯 무엇을 평가하는가
재귀적 자기 개선의 가장 이른 사례의 메커니즘을 이해하는지 탐색합니다. 상대는 개선 대상이 도대체 무엇인지, 그리고 재귀가 언제 유효하고 언제 무효가 되는지를 듣기 원합니다.
🧭 답변 프레임워크
  1. 먼저 대상을 바로잡으세요:STOP은 해답 s를 직접 개선하지 않습니다. 반복해 개선하는 것은 더 나은 해답을 만드는 「개선기」 I 자체입니다. 시드 개선기는 초기 해답, 효용 함수, 블랙박스 모델 세 입력을 받아 개선된 해답을 반환합니다.
  2. 재귀의 열쇠를 설명:개선기 자체도 텍스트(한 단락의 Prompt 또는 코드)이므로, 같은 개선 논리를 개선기 자신에 적용할 수 있습니다:I_t = I_{t-1}(û, I_{t-1}; M). 오늘의 자신이 어제의 자신을 업그레이드합니다.
  3. 실험 답을 주세요:진짜 좋아질 수 있지만 허들이 있습니다. GPT-4가 구동하면 지속 개선되고, 유전 알고리즘, 분해 개선, 다중 팔 Prompt Bandit, 시뮬레이션 어닐링, Beam Search 같은 고전 최적화 전략을 자동으로 발견했습니다;GPT-3.5와 Mixtral이 구동하면 오히려 퇴화합니다.
  4. 결론을 주세요:재귀 구조가 주는 것은 개선의 가능성일 뿐, 수렴은 보장되지 않습니다. 약한 모델은 메타 수준 조작에서 프로그래밍 직관이 없어 노이즈만 증폭합니다.
⭐ 가산점「고전 전략을 자동 발견」의 깊은 뜻을 말하세요:아무도 유전 알고리즘이나 Beam Search를 미리 넣지 않았는데, 개선기가 스스로 이 구조들을 키워 냈습니다. 충분히 강한 모델에 재귀 구조를 더하면, 인류가 최적화 분야에서 수십 년 쌓은 밑천을 다시 발명할 수 있습니다. 이것이 메타 수준 최적화의 상상 공간입니다.
이 강의 페이지로 답변을 구성하세요 → Harness가 스스로 개선하게 하기
Q18면접관
「Agent가 실패한 그 궤적들은 보통 어떻게 처리하나요? 그냥 버리나요, 아니면 뭔가 짜낼 수 있나요?」
🎯 무엇을 평가하는가
실패를 자산으로 보는 의식과 방법론이 있는지 확인합니다. 「오류 로그를 남긴다」는 너무 얕고, 듣고 싶은 것은 구조화된 실패 발굴을 어떻게 하는지입니다.
🧭 답변 프레임워크
  1. 방법 이름을 주세요:Self-Harness의 첫 단계가 바로 Weakness Mining입니다:실패 궤적을 verifier-grounded 실패 패턴으로 클러스터링해, 개별 사례에서 패턴으로 올립니다.
  2. 기록 규격을 설명:실패마다 세 가지 세트입니다:터미널 검증기 수준의 실패 원인, 관련 Agent 행동의 인과 상태, 궤적이 노출한 추상 Agent 메커니즘. 이 세 가지가 있어야 실패를 주소 지정할 수 있습니다.
  3. 다운스트림 용법을 설명:제안 단계에서는 주소 지정 가능한 반복 오류 패턴을 우선 손댑니다. 한 곳을 고쳐 한 종류를 고치고, 머리 아픈 곳만 고치는 일을 피합니다.
  4. PM이 적용할 지점을 주세요:실패 궤적 라이브러리를 어떻게 만들고 어떤 차원으로 클러스터링할지는, PM이 지금 바로 밀 수 있는 인프라이며 방법을 그대로 가져오면 됩니다.
⭐ 가산점「verifier-grounded」라는 수식어의 무게를 짚으세요:실패 원인을 검증 가능한 단말 신호에 고정해야, 모인 패턴이 모델이 스스로 지어낸 병인이 되지 않습니다. 이 앵커가 없으면 실패 라이브러리가 클수록 더 오도합니다.
이 강의 페이지로 답변을 구성하세요 → Harness가 스스로 개선하게 하기
Q19면접관
「Agent가 자기 설정을 스스로 고치게 할 때, 여기를 고치면서 다른 곳이 몰래 나빠지지 않게 어떻게 보장하나요?」
🎯 무엇을 평가하는가
개선 폐루프의 품질 게이트 설계를 테스트합니다. 자기 개선을 프로덕션에 올릴 수 있는지의 핵심 고리이며, 검증 메커니즘을 말하지 못하는 사람은 Self-Harness를 들어 본 수준입니다.
🧭 답변 프레임워크
  1. 검증 메커니즘을 주세요:Self-Harness 3단계 Proposal Validation은 held-in과 held-out 두 데이터셋으로 후보 편집을 검증하고, 회귀가 없는 편집만 받습니다. 개선이 기존 능력을 희생해서는 안 됩니다.
  2. 편집 범위를 설명:제안 자체가 유한한 Harness 편집입니다. 모델이 받는 것은 편집 가능한 면, 실패 패턴 요약, 통과 행동 기록, 이미 시도한 편집 히스토리이며, 손을 대기 전에 이미 틀이 씌워져 있습니다.
  3. 실험 증거를 주세요:Terminal-Bench-2에서 MiniMax M2.5, Qwen3.5-35B-A3B, GLM-5로 실험했고, Self-Harness는 각 모델에 모델 특화 harness 지시를 학습시켰습니다.
  4. 제품 함의를 말하세요:같은 프레임워크가 서로 다른 기반 모델에서 다른 최적화 경로를 만든다는 것은, harness 개선이 컨텍스트에 민감하다는 뜻입니다. 모델을 바꿀 때 harness 설정을 그대로 가져오면 안 되고, 최적화를 한 바퀴 다시 돌려야 합니다.
⭐ 가산점「이미 시도한 편집 히스토리」라는 입력의 역할을 짚으세요:제안기가 같은 아이디어 위를 반복해 맴돌지 않게 하며, 자기 개선에 중복 제거 기억을 더하는 것과 같습니다. 이런 작은 설계가 루프가 수렴하는지를 결정하는 경우가 많습니다.
이 강의 페이지로 답변을 구성하세요 → Harness가 스스로 개선하게 하기
Q20상사
「이렇게 가면 Agent가 다 스스로를 고치게 될 텐데, 엔지니어를 이렇게 많이 두고, 당신 같은 프로덕트 매니저는 앞으로 뭘 하나요?」
🎯 무엇을 평가하는가
상사는 반쯤 농담, 반쯤 진지합니다. 폐루프 안에서 사람의 새 위치를 말할 수 있는지, 그리고 당신이 당황하는지를 봅니다. 답은 직무가 어떻게 바뀌는지까지 구체적이어야 하고, 「사람은 중요하다」고만 외치면 소용없습니다.
🧭 답변 프레임워크
  1. 먼저 방향을 주세요:답은 일곱 가지 관문의 마지막 관문에 있습니다:인간은 스택에서 위로 이동하고, 루프 안에 계속 남습니다. AI가 실행 레이어를 인수하면, 사람의 가치는 목표 설정, 방향 판단, 하한선 지키기로 올라갑니다.
  2. 구체 직무를 주세요:사람이 유지해야 하는 것이 있습니다:평가기와 권한 제어는 개선 루프 밖에 두어야 하고;편집 가능한 면의 경계는 사람이 그어야 하며;어떤 문제가 풀 가치가 있는지는 사람이 정의해야 합니다.
  3. 증거를 주세요:자동 연구의 여섯 가지 실패 모드 중 「약한 과학적 안목」과 「도메인 지능 부족」이 마침 사람의 강점입니다:질문이 물어볼 가치가 있는지 판단하고, 문서에 못 적는 암묵지를 갖추는 것.
  4. 태도로 마무리하세요:강좌 끝의 그 문장을 인용하세요:사람은 시스템에서 없어서는 안 될 방향키이며, 대체되어야 할 병목이 아닙니다. 감독은 올바른 시간과 올바른 추상화 레벨에서 일어나야 합니다.
⭐ 가산점인재 전략으로 옮기세요:계층이 위로 간다는 것은 평가 체계와 목표 정의 능력이 팀에서 가장 희소한 자산이 된다는 뜻이고, 채용과 육성의 무게중심은 「출제할 줄 알고, 검수할 줄 아는」 쪽으로 옮겨야 합니다. 상사가 원하는 것은 바로 이런, 조직에 적용되는 판단입니다.
이 강의 페이지로 답변을 구성하세요 → 미래 과제:자기 개선의 일곱 가지 관문
Q21면접관
「Darwin Gödel Machine이라는 이름은 꽤 위압적인데, Agent를 도대체 어떻게 진화시키나요? 내놓을 숫자가 있나요?」
🎯 무엇을 평가하는가
harness 자기 개작의 가장 급진적인 사례를 파악했는지 확인합니다. 이름은 누구나 읽지만, 듣고 싶은 것은 진화 루프의 각 단계 동작과, 외울 수 있는 실험 숫자입니다.
🧭 답변 프레임워크
  1. 먼저 대상을 설명:DGM은 편집 가능한 harness 코드 저장소를 명시적으로 대상으로 진화합니다. Agent가 자기 harness 코드를 수정하도록 허용하며, 이 점은 AlphaEvolve가 남의 프로그램을 고치는 것보다 더 급진적입니다.
  2. 루프를 설명:풀의 한 coding agent에서 시작하고;성능 확률로 부모를 고르며;부모 agent가 자기 benchmark 평가 로그를 보고 개선안을 내고;변이로 새 agent를 만들며;평가 후 성능이 충분할 때만 풀에 넣고;정지 조건까지 순환합니다.
  3. 숫자를 제시:Claude 3.5 Sonnet 기반으로 SWE-bench Verified는 20%에서 50%로, Polyglot은 14.2%에서 30.7%로 올렸고, 전 과정 인간 개입이 없었습니다.
  4. 도구 면을 보완:도구 세트는 놀라울 만큼 소박합니다:bash에 editor(view / create / edit). 위력은 루프 설계에 있고, 화려한 도구는 필요 없습니다.
⭐ 가산점부모 선택의 반비례 설계를 따로 짚으세요:선택 확률이 자식 수에 반비례해, 이미 자손이 많은 개체는 가중치를 낮추고 비인기 가지 탐색을 장려합니다. 이는 진화 루프 안에 다양성 붕괴를 막는 메커니즘을 내장한 것과 같습니다.
이 강의 페이지로 답변을 구성하세요 → 진화 검색:가장 강한 Harness의 생존
Q22면접관
「Prompt 자동 최적화 도구는 몇 년 전부터 있었습니다. Promptbreeder, GEPA 같은 옛 작업은 지금 봐도 가치가 있나요?」
🎯 무엇을 평가하는가
당신의 기술사 관점을 테스트합니다. 옛 작업을 진화 라인에 놓을 수 있는 사람이, 새 용어만 쫓는 사람보다 훨씬 믿을 만합니다.
🧭 답변 프레임워크
  1. Promptbreeder를 설명:풍부한 변이 연산으로 task-specific prompts를 진화시킵니다. 핵심 혁신은 메타 진화입니다:변이 prompt 자체도 진화로 개선되어, 고치는 방법까지 진화합니다.
  2. GEPA를 설명:reflection-based prompting과 진화 검색을 결합합니다:Agent가 먼저 현재 prompt의 부족을 성찰하고, 진화 연산자로 후보 개선을 만든 뒤 최적을 고릅니다.
  3. 역사적 위치를 주세요:두 작업은 prompt 진화의 선구이며, 이후 더 큰 규모의 Harness 진화(AlphaEvolve, DGM)의 기반을 놓았습니다. 텍스트가 진화할 수 있음을 증명했고, 후속은 진화 가능한 대상을 코드와 전체 harness로 넓혔습니다.
  4. 볼 가치가 있는지 답하세요:있습니다. 메타 진화라는 핵심을 이해하면, 새 논문을 읽을 때 전부 어디선가 본 듯합니다.
⭐ 가산점이 실마리를 그리세요:Promptbreeder는 변이기를 진화시키고, STOP은 개선기를 개선하며, MCE는 관리 메커니즘을 최적화합니다. 세 시기, 세 이름이고, 핵심은 모두 개선 방법 자체를 개선 루프에 넣는 것입니다. 동형을 볼 수 있는 사람은 새것을 가장 빨리 배웁니다.
Q23기술 동료
「harness를 이미 자동 최적화할 수 있다면, 모델 가중치도 같은 루프에 넣어 같이 훈련하면 한 번에 끝나는 거 아닌가요? 믿을 만하다고 보나요?」
🎯 무엇을 평가하는가
급진 방안을 따라 같이 흥분할 것인지, 리스크를 짚을 수 있는지 탐색합니다. 「믿을 만하다」와 「완전히 안 된다」 모두 감점이고, 메커니즘에 리스크를 더한 균형 평가를 줘야 합니다.
🧭 답변 프레임워크
  1. 먼저 메커니즘을 설명:이것이 바로 SIA의 방식입니다. 세 역할이 같은 최적화 루프에 들어갑니다:Meta-Agent가 새 harness 설계를 제안하고, Task-Specific Agent가 새 harness 아래에서 태스크를 실행하며, Feedback-Agent가 결과에 따라 다음에 harness를 업데이트할지 모델 가중치를 업데이트할지 결정합니다.
  2. 평가를 주세요:방향은 흥미롭지만, 증거는 아직 예비적입니다. 두 가지 열린 과제가 풀리지 않았습니다:훈련 안정성, 그리고 Goodhart 효과, 대리 지표를 최적화하다 실제 목표가 퇴화하는 것.
  3. 비유로 리스크를 말하세요:레이싱카 엔진을 고치면서 트랙도 같이 고치면, 양쪽이 동시에 변해 문제가 생겨도 누구에게 원인을 돌려야 할지 모릅니다.
  4. 제안을 주세요:단기에는 harness 최적화와 가중치 훈련을 따로 도는 편이 더 안정적이고, 한쪽 루프가 수렴하고 통제 가능해진 뒤에야 공동 최적화를 이야기하세요.
⭐ 가산점SIA와 이전 모든 방법의 본질 차이를 짚으세요:앞선 경로는 모두 가중치를 일부러 건드리지 않고 개선을 Harness 층에 가둬, 그래서 검증과 롤백이 가능했습니다. 가중치를 루프에 넣는 것은 이 안전 패드를 뜯는 것과 같고, 가장 살펴봐야 할 지점입니다.
Q24면접관
「AlphaEvolve가 새 알고리즘을 발견한 일은 꽤 화제가 됐습니다. 제품 관점에서, 그 시스템 설계에서 베낄 만한 것은 무엇인가요?」
🎯 무엇을 평가하는가
스타 사례에서 재사용 가능한 설계 요소를 뽑아낼 수 있는지 확인합니다. 「AI가 새 알고리즘을 발견했다」는 이야기만 할 줄 아는 사람은 이 관문을 넘지 못합니다.
🧭 답변 프레임워크
  1. 메인 루프를 설명:후보 프로그램 풀을 유지하고, 동결된 LLM이 코드 diffs를 생성해 프로그램을 개선하며, 서브프로그램을 반복 평가하고 가장 좋은 것을 남깁니다. 모델은 전 과정 훈련하지 않고, 향상은 전부 검색 루프에서 옵니다.
  2. prompt 설계를 분해하세요:진화 prompt는 부모 프로그램, 평가 결과, 지시, 메타 정보로 구성됩니다;EVOLVE-BLOCK 마커로 개선 가능 영역을 명시적으로 표시해, 검색을 정해 둔 범위 안에 가둡니다.
  3. meta-prompt를 설명:지시와 컨텍스트 자체도 공동 진화에 참여하며, 고정되어 있지 않습니다.
  4. 소거 실험을 인용:진화 프로세스, 컨텍스트 prompt, meta-prompt, 전체 파일 진화, 더 강한 LLM. 소거는 각각이 독립 기여가 있음을 증명했습니다. 베낄 만한 것은 바로 모든 컴포넌트의 필요성을 검증한 이 방식입니다.
⭐ 가산점성과를 뒷받침한 뒤 경계를 한 줄 더하세요:구글은 이것으로 인류가 알던 것보다 빠른 행렬 곱셈 알고리즘을 실제로 찾았습니다. 하지만 EVOLVE-BLOCK 마커는 인간이 먼저 어디를 움직일 수 있는지 정한다는 뜻이고, 진화가 아무리 강해도 사람이 그은 원 안에서 달립니다.
이 강의 페이지로 답변을 구성하세요 → 진화 검색:가장 강한 Harness의 생존
Q25상사
「지난번에 말한 그 자동 최적화 방법들은 다 좋아 보이는데, 컴퓨팅을 얼마나 태우나요? 계산서를 보여 주세요.」
🎯 무엇을 평가하는가
상사는 비용 구조와 투입 리듬을 원합니다. 논문을 읊는 것은 소용없습니다. 듣고 싶은 것은 돈이 어느 고리에 쓰이는지, 어떤 방법이 비싼지, 싼 것부터 올릴지 비싼 것부터 올릴지입니다.
🧭 답변 프레임워크
  1. 비용의 큰 덩어리를 설명:검색류 방법의 비용은 평가에 몰립니다:매 라운드가 LLM 추론에 코드 실행에 벤치마크 테스트이고, 세대가 많을수록 더 태웁니다. 계산 효율(세대당 평가 횟수)과 진화 효과(세대당 향상)를 어떻게 균형 맞출지는 학계에서도 아직 열린 문제입니다.
  2. 비싼 순서를 주세요:ACE식 구조화 컨텍스트 유지가 가장 가볍고, 정상 태스크 흐름 안에서 돕니다;MCE 이중 레이어는 skill 진화 루프를 한 층 더 키워야 합니다;Meta-Harness는 한 버전을 고칠 때마다 완전한 시험 실행과 채점이 필요해, 셋 중 계산이 가장 무겁습니다.
  3. 투입 리듬을 주세요:먼저 ACE식 유지로 긴 태스크를 안정시키고, 그다음 자동으로 돌릴 평가 세트를 만들며, 평가가 선 뒤에야 검색류 방법의 어느 단계를 올릴지 평가하세요.
  4. 손절 선을 주세요:평가 한 번에 몇 시간이 걸리고, 지표가 주관적이며, 예산이 빠듯하면 — 이 세 가지 중 해당되면 경량 단계에 머무세요. 이것 또한 강좌가 명시적으로 적은 진화 검색 부적합 시나리오입니다.
⭐ 가산점돈 아끼는 재치를 하나 주세요:Meta-Harness의 TerminalBench-2 실험은 이미 있는 강한 harness에서 초기화했고, 좋은 기준선에서 이어서 검색하는 것이 제로에서 검색하는 것보다 훨씬 쌉니다. 우리가 손으로 조율한 harness의 축적이, 장차 자동 최적화의 출발 자산입니다.
Q26면접관
「다들 성공 사례를 경험 라이브러리에 쌓는데, 실패한 막다른 길도 저장해야 하나요? 저장하면 Agent가 빗나가지 않을까요?」
🎯 무엇을 평가하는가
기억 내용 설계의 깊이를 테스트합니다. 대부분은 성공 경험만 떠올리고, 부정 결과의 가치와 저장법은 이 장에서 가장 직관에 반하는 출제점 중 하나입니다.
🧭 답변 프레임워크
  1. 먼저 입장을 주세요:저장해야 합니다. 무엇이 안 되는지를 아는 것과 무엇이 되는지를 아는 것은 똑같이 중요하고, 연구 Harness는 실패한 시도와 막다른 길을 쉽게 저장하고 검색할 수 있게 해야 합니다.
  2. 왜 어려운지 설명:과학 문헌은 성공 사례에 심하게 편향되어 있고, LLM은 언제 가설을 포기할지, 언제 부정 결과를 솔직히 보고할지 결정하는 데 서툴 수 있습니다. 이 편향은 자동 연구 시스템에 그대로 상속됩니다.
  3. 빗나가지 않게 저장하는 법을 설명:부정 결과의 용도는 가지치기입니다. 무엇을 시도했고, 어떻게 실패했고, 원인이 무엇인지를 분명히 표시해, Agent가 검색하면 막다른 길을 다시 걷지 않게 합니다. Self-Harness가 제안기에 「이미 시도한 편집 히스토리」를 먹이는 것도 같은 논리입니다.
  4. 실패 모드로 다시 연결:자동 연구의 「과도한 낙관주의」 버릇(기준선을 유의미하게 능가한다고 주장하지만 실제는 전부 노이즈)은, 시스템이 부정 결과를 솔직히 기록하는 습관이 없음을 보여 줍니다.
⭐ 가산점직관에 반하는 인지 한 줄로 마무리하세요:부정 결과 라이브러리는 중복 탐색을 막는 지도이면서, 심사 단계의 대조군이기도 합니다. 경험 라이브러리에 성공 사례만 쌓는 팀은, Agent에게 모든 막다른 길을 다시 부딪히라고 강요하는 것과 같습니다.
Q27면접관
「내일부터 자기 개선 Agent 프로젝트를 맡긴다면, 첫 일로 리스크 목록을 쓴다고 할 때 어떤 항목을 적겠습니까?」
🎯 무엇을 평가하는가
이 장의 마무리 프레임워크를 체계적으로 파악했는지 확인합니다. 리스크 두세 개를 흩어 말하기는 어렵지 않고, 듣고 싶은 것은 완전한 분류 지도와, 각 종류에 대응하는 해법 방향입니다.
🧭 답변 프레임워크
  1. 먼저 분류 프레임워크를 주세요:일곱 가지 관문은 네 종류입니다:평가 관련, 데이터와 메모리, 안전과 안정성, 인간의 역할. 종류별로 말하면 빠지기 어렵습니다.
  2. 평가와 기억을 지나세요:약하고 모호한 평가기(많은 목표에 빠르고 정확한 검증기가 없어 피드백 신호가 흐림);컨텍스트와 메모리 라이프사이클(기억 수요가 자율성과 함께 폭발하고, 컨텍스트 엔지니어링은 지능 자체의 핵심이 되어야 함);부정 결과(실패한 시도를 쉽게 저장하고 검색할 수 있어야 함).
  3. 안전 세 관문을 지나세요:다양성 붕괴(후보가 미세한 변체로 몰려 혁신이 멈춤), 보상 해킹(테스트 과적합, 판단 모델 허점 이용, benchmark 허점 악용), 장기 성공(테스트 통과만 보고 유지보수성, 소유권 경계, 마이그레이션 비용, 하위 호환을 무시).
  4. 인간의 역할로 마무리하세요:일곱 번째 관문은 사람의 위치입니다:올바른 시간, 올바른 추상화 레벨에서 감독을 제공합니다. 이 일곱 가지는 근본적인 시스템 설계 과제이며, 평범한 엔지니어링 문제로 보고 이터레이션에 넣으면 끝나는 일이 아닙니다.
⭐ 가산점네 종류의 내재 순서를 말하세요:평가기는 피드백 신호의 근원이고, 신호가 틀리면 뒤가 전부 틀리므로 「약한 평가기」가 일곱 가지 관문 첫 자리에 있습니다. 리스크 목록도 이 우선순위로 정렬해야 하고, 먼저 어떻게 채점할지를 푼 뒤에야 어떻게 개선할지를 이야기하세요.
이 강의 페이지로 답변을 구성하세요 → 미래 과제:자기 개선의 일곱 가지 관문
Q28기술 동료
「말씀하신 논문이 하나보다 하나가 더 아득합니다. 솔직히, 다음 분기에 쓸 수 있는 것과 5년 안에는 꿈도 꾸지 말 것은 무엇인가요?」
🎯 무엇을 평가하는가
기술 동료는 믿을 만한 성숙도 계층을 원합니다. 전부 부풀리거나 전부 깎아내리면 신뢰를 잃습니다. 이 문제를 잘 답하면, 이후 협업이 수월해집니다.
🧭 답변 프레임워크
  1. 「지금 바로 쓰라」층:세 가지 설계 패턴(자동화 루프, 파일시스템 기억, 하위 Agent 병렬)은 이미 Claude Code, Codex, Cursor의 기본 사양이고, 최강 Agent 시스템 아키텍처 결정의 90%를 커버하니, 그대로 짜면 됩니다.
  2. 「다음 분기에 시험」층:ACE식 구조화 컨텍스트 유지. Generator, Reflector, Curator는 선명한 엔지니어링 파이프라인이고, 전제는 먼저 평가 세트로 수렴을 검증하는 것입니다.
  3. 「조건이 되면 올리라」층:AFlow, DGM 같은 검색 방법은 평가 자동화, fitness 수치화, 충분한 컴퓨팅을 만족해야 합니다. 코딩류 태스크가 가장 먼저 혜택을 보고, DGM의 SWE-bench 숫자가 바로 이런 조건에서 나온 것입니다.
  4. 「계속 관찰」층:SIA 공동 최적화의 훈련 안정성은 아직 풀리지 않았고, Meta-Harness는 계산이 가장 무거워, 둘 다 아직 증거가 예비적인 단계이니 논문을 따라가면 됩니다.
⭐ 가산점범용 판정 기준을 주세요:한 방법이 적용까지 남은 거리는, 기본적으로 「빠르고 신뢰할 평가기」에 얼마나 깊게 의존하는지, 그리고 당신 손의 평가기가 얼마나 성숙한지에 달립니다. 평가 인프라가 숨은 크리티컬 패스입니다.
Q29면접관
「말씀하신 다양성 붕괴는 도대체 어떤 모습인가요? 시스템은 점수가 계속 오르는데, 이미 몰래 붕괴했다는 것을 어떻게 아나요?」
🎯 무엇을 평가하는가
진화 시스템의 만성병을 이해하는지 확인합니다. 이 실패 모드는 단기에 증상이 없고, 모습과 해독제, 모니터링 방식을 설명할 수 있어야 진짜로 이해한 것입니다.
🧭 답변 프레임워크
  1. 병리를 설명:진화 알고리즘과 RL 루프는 알려진 고보상 패턴을 자연스럽게 이용하는 경향이 있어, 단기 점수는 아주 좋아 보이고 문제가 가려집니다.
  2. 증상을 설명:개체군 안의 모든 후보 해가 같은 방안의 미세한 변체로 붕괴하고, 새 세대가 이전 세대와 점점 닮아 혁신이 멈춥니다. 강좌의 비유가 정확합니다:반 전체가 1등 숙제를 베끼면 점수는 좋아 보이지만, 더는 아무도 새 풀이를 생각해내지 않습니다.
  3. 해독제를 주세요:해 공간 붕괴를 막는 전용 메커니즘이 필요합니다:다양성 보상, 아카이브 보존.
  4. 모니터링 제안을 주세요:점수 곡선만 보면 붕괴가 보이지 않고, 개체군 안 방안의 차이 정도를 재야 합니다. 차이가 0에 가까워지는 것이 경보이고, 점수 하락보다 훨씬 먼저 옵니다.
⭐ 가산점보상 해킹과 구분하는 것이 가장 실력을 보여 줍니다:보상 해킹은 점수가 부풀려 있고 진짜 능력은 안 오른 것이고;다양성 붕괴는 점수는 진짜지만 혁신이 멈춘 것입니다. 두 병의 증상은 반대이고 뿌리는 같습니다:최적화 압력이 숫자 하나만 알아봅니다.
Q30상사
「AI가 쓴 코드는 테스트를 다 통과하고 온라인에도 사고가 없는데, 코드 리뷰는 생략해도 되는 거 아닌가요? 사람이 보기엔 너무 느립니다.」
🎯 무엇을 평가하는가
상사는 비용 절감 지점을 찾고 있습니다. 「테스트 통과」와 「저장소 건강」의 간극을 설명할 수 있는지, 그리고 대안을 줄 수 있는지를 보며, 안 된다고만 하면 소용없습니다.
🧭 답변 프레임워크
  1. 먼저 병의 뿌리를 주세요:이것이 일곱 가지 관문의 「장기 성공」입니다:현재 최적화 목표가 너무 단기라, 코딩 Agent는 눈앞 태스크는 끝내지만 코드베이스의 장기 건강을 어떻게 지킬지는 충분히 모릅니다.
  2. 테스트가 못 잡는 것을 나열:표준 샌드박스 RLVR 훈련은 유지보수성, 소유권 경계, 마이그레이션 비용, 하위 호환성을 거의 포착하지 못합니다. 이것들이 마침 사람 리뷰가 지키는 관문입니다.
  3. 리스크 화면을 주세요:테스트 통과만 추구하는 Agent는 기술 부채 안에 시한폭탄을 묻을 수 있습니다. 폭탄이 터지는 날은 어떤 테스트 보고서에도 적히지 않습니다.
  4. 절충안을 주세요:리뷰는 형태를 바꿀 수 있습니다:일상 변경은 가볍게 보고, 아키텍처 층 변경은 중점으로 봅니다. 사람은 위로 이동해 소유권 경계와 장기 구조를 보고, 줄 단위 검사는 도구에 맡깁니다.
⭐ 가산점상사의 기대를 교정하세요:자기 개선 연구의 최첨단조차 장기 건강을 재기 어렵다는 것을 근본 과제 중 하나로 올려 두었으니, 우리 팀만의 프로세스 문제가 아닙니다. 단기에는 사람 리뷰를 줄일 수 없고, 줄일 수 있는 것은 계층입니다. 사람의 시간을 기계가 측정하지 못하는 그 부분에 쓰세요.
이 강의 페이지로 답변을 구성하세요 → 미래 과제:자기 개선의 일곱 가지 관문
마지막 조언
이 장의 지식은 가장 최신이며, 허세 부리기도 가장 쉽습니다. 이 30가지 질문의 올바른 사용법은 소리 내어 한 번 말해보는 것입니다 — 동료, 친구, 또는 녹음을 상대로. 말이 막히는 부분이 바로 이해했다고 생각했지만 실제로는 아직 이해하지 못한 부분입니다. 연결된 강좌 페이지를 클릭해 복습하세요.