논문 기반 노트
연구 논문을 업무 설계, 조직 운영, 지식노동의 질문으로 다시 읽은 노트입니다.
총 110개 노트
데이터 에이전트는 첫 계획 하나에 모든 것을 걸면 안 된다
데이터 분석 에이전트가 여러 초기 계획을 먼저 만들고 일부를 골라 병렬 실행하는 CIPHER를 통해, 분석 자동화에서 탐색·선택·종합을 분리해야 하는 이유를 읽었습니다.
좋은 피드백은 전문가 점수만으로 완성되지 않는다
1,899명의 대학생과 2만여 편의 영어 글쓰기 초안을 통해, 교사가 높게 평가한 AI 피드백과 학습자가 실제로 쓰는 피드백이 왜 다를 수 있는지 읽었습니다.
봇이 팀원이 되는 순간, 조직의 규칙도 달라진다
2,991개 오픈소스 프로젝트의 봇 도입 전후를 따라가며, AI 에이전트의 효과가 자동화 자체보다 반복 협업·사회적 기억·역할 분화에서 생길 수 있다는 연구를 읽었습니다.
웹 에이전트는 클릭뿐 아니라 설명까지 남겨야 한다
웹 에이전트 벤치마크 MAG를 통해, 실제 화면 위에서 과업을 수행하는 능력과 다음 사용자를 위한 안내 문장을 함께 평가해야 한다는 점을 읽은 논문 메모입니다.
AI 튜터 평가는 시뮬레이션 다음의 교실을 봐야 한다
RAG와 지식 구성요소 모델을 결합한 AI 튜터 LEA의 실제 수업 배포와 교차 과목 확장성 평가를 HRD·교육평가 관점에서 읽은 논문 메모입니다.
AI 도입은 첫인상보다 사용 후 이동을 봐야 한다
공공기관 Microsoft 365 Copilot 8주 파일럿을 따라가며, 직원의 AI 수용 태도가 사용 전 기대에서 사용 후 재보정으로 어떻게 이동하는지 읽은 논문 메모입니다.
에이전트도 쉬운 일을 쉬운 일로 알아야 한다
LLM 에이전트가 간단한 수정에도 과하게 파일을 읽고 문맥을 모으는 문제를 ‘실행 중복’으로 보고, 먼저 난이도와 필요한 범위를 추정한 뒤 최소 경로로 검증하자는 E3 접근을 읽었다.
교육 대시보드는 점수보다 해석을 담아야 한다
학습분석 대시보드가 클릭·점수·완료율을 보여주는 화면을 넘어, 전문가가 학습자의 오개념과 판단 과정을 해석하는 인프라가 되어야 한다는 문제의식을 HRD 관점에서 읽었다.
AI 팀원도 실험 변수로 다뤄야 한다
AI를 팀에 넣을 때 필요한 것은 더 친절한 챗봇이 아니라, 말투·개입 빈도·기억·분석 로그를 재현 가능한 조건으로 다루는 실험 설계라는 점을 짚은 논문 메모.
GraphRAG의 병목은 검색보다 지식 정리 순서에 있다
GraphRAG를 한 번에 만들지 않고 추출, 중복 제거, 요약, 커뮤니티 탐지를 분리한 RAGU 논문을 실무 지식관리 관점에서 읽었다.
AI 채점은 종이를 없애는 일이 아니라 검토 지점을 좁히는 일이다
고등교육의 지필 시험을 완전히 디지털화하지 않고, 구조화된 답안과 비전 LLM 검증으로 채점 부담을 줄이는 하이브리드 평가 논문 메모.
AI 도입은 실험할 수 있는 조직에서야 성과가 된다
AI 도입을 성과의 원인으로 바로 놓지 않고, 감지 역량과 실험 역량을 거치는 조직 능력의 문제로 읽어본 논문 메모.
스프레드시트 에이전트는 셀 하나보다 업무 전체에서 무너진다
비즈니스 스프레드시트 업무를 끝까지 수행하는 에이전트를 평가한 벤치마크 연구. 자동화의 병목이 수식 하나가 아니라 검사·수정·시각화의 전체 흐름에 있음을 보여준다.
평가 문항을 AI와 만들 때, 작은 모델이 더 현실적일 수 있다
교육평가 문항 설계에서 소형·로컬 언어모델을 대형 모델과 비교한 연구. 품질, 개인정보, 비용, 사람의 검토를 함께 보는 평가 업무 설계 노트.
에이전트 평가는 정답보다 실제 사용의 루프를 봐야 한다
에이전트를 평가하려면 한 번 맞혔는지보다, 실제 도구·파일·피드백 루프 안에서 어디서 막히는지 봐야 한다.
교육 데이터는 차트보다 이야기로 배워질 때가 있다
학습자가 차트를 못 읽는다고 탓하기 전에, 데이터가 어떤 순서와 이야기로 제시되는지 다시 설계해야 한다.
AI 도입은 신뢰보다 먼저 버틸 구조를 물어야 한다
AI를 윤리·정확도 문제로만 다루면, 서비스가 멈췄을 때 누가 어떻게 버틸지라는 더 현실적인 질문이 빠진다.
프롬프트가 아니라 계약으로 에이전트를 묶어야 한다
기업용 LLM 에이전트를 제품으로 쓰려면 좋은 프롬프트보다 출처, 라우팅, 출력 형식, 검증 흔적을 코드가 소유하는 계약 구조가 먼저 필요하다.
교육 AI는 강사를 대체하기보다 훈련 빈칸을 메운다
항공교통관제 훈련 시뮬레이터 ASTRA는 AI가 강사를 대체한다는 말보다, 반복 훈련과 평가의 빈칸을 어떻게 표준화하고 넓힐 수 있는지 보여준다.
자동화는 ‘얼마나 많이’가 아니라 ‘언제 넘길지’의 문제다
챗봇과 사람 상담원을 함께 쓰는 서비스에서, 자동화를 많이 하는 것보다 중요한 것은 대기열과 실패 가능성을 보며 언제 사람에게 넘길지 정하는 일이다.
에이전트 기억은 저장소가 아니라 개입 타이밍이다
장기 작업 에이전트에서 메모리를 더 많이 저장하는 문제가 아니라, 필요한 순간에 행동 루프에 다시 개입시키는 문제로 읽은 논문 메모.
AI 채점은 점수보다 피드백에서 먼저 써야 한다
K-12 평가에서 LLM 채점기를 검증한 논문을, 자동 채점의 가능성보다 평가 운영과 피드백 설계의 경계라는 관점에서 읽었다.
에이전트가 푼 일은 자동화 자산으로 굳혀야 한다
AI 에이전트를 매번 새로 추론하게 두지 않고, 반복 검증된 해결 경로를 결정적 워크플로로 전환하는 progressive crystallization을 읽는다.
교육평가는 쉬운 명령의 위험까지 봐야 한다
명령어 교육을 단순 난이도가 아니라 실제 시스템 영향까지 포함해 평가하려는 CogTax를, HRD·업무역량 평가의 관점에서 읽었다.
데이터 분석 AI는 표 하나보다 messy한 현장을 견뎌야 한다
DataGovBench 논문은 실제 공공데이터처럼 큰 다중 표, 메타데이터, 외부지식, 탐색적 인사이트가 얽힌 조건에서 LLM 데이터 분석 능력을 평가한다.
평가는 정답보다 디버깅 과정을 남겨야 한다
최종 코드와 테스트 결과만으로는 학생이 어떻게 실패를 재현하고 가설을 세우고 수정했는지 보이지 않는다. DebugTracker 논문을 교육평가와 업무 피드백 관점에서 읽었다.
AI 코딩 협업은 대화보다 기여 흐름을 봐야 한다
오픈소스 저장소의 AI 대화 세션과 개발 이력을 연결해, 코딩 에이전트가 코드 작성·협업·유지보수 인식에 남기는 흔적을 읽은 연구를 업무 설계 관점에서 정리했다.
에이전트의 기억은 사실보다 판단 기록에서 먼저 오염된다
LLM 에이전트의 장기 기억에서 사실 지식뿐 아니라 과거 판단·추론 기록이 공격 표면이 될 수 있다는 FARMA와 SENTINEL 연구를 읽었다.
AI 피드백은 많이 쓰는 것보다 무엇을 놓쳤는지가 먼저다
학생 글쓰기 피드백 데이터셋 SEFORA와 평가 프레임워크 UniMatch를 통해, AI 피드백 자동화에서 양보다 우선순위와 누락을 봐야 한다는 점을 읽었다.
전문가의 수정은 채팅 로그가 아니라 팀 기억이 되어야 한다
AI 번역 워크플로에서 사람의 개입을 일회성 수정이 아니라 팀이 다시 쓸 수 있는 근거와 선례로 남기는 방법을 읽었다.
LLM을 매번 부르지 않고, 작은 함수로 남기는 상상
자연어로 적은 애매한 업무 함수를 작은 로컬 실행 아티팩트로 컴파일하는 Program-as-Weights 논문을 읽고, 에이전트·RAG·자동화 설계의 실행 비용과 재현성 문제를 정리했다.
AI 채점은 모델보다 루브릭이 먼저다
Linux/bash 단답형 시험 1,200개를 네 개 LLM과 사람 채점자 기준으로 비교한 연구를 읽고, AI 채점을 어디까지 자동화하고 어디서 사람 검토를 남겨야 하는지 정리했다.
AI 팀이라고 부르기 전에, 먼저 어떤 팀인지 물어야 한다
인간-AI 팀 연구 53편을 다섯 가지 팀 유형으로 나눈 논문을 읽고, 조직의 AI 도입에서 ‘AI를 팀원으로 쓴다’는 말을 더 정확하게 쓰는 법을 정리했다.
RAG가 맞게 찾았어도, 오래된 지식이면 실패다
에이전트가 검색한 지식의 출처, 버전, 승인 상태, 재현 가능성을 관리해야 한다는 ContextNest 논문을 읽었다.
사람·기술·프로젝트를 한 장에 놓고 보면 보이는 것
작은 조직의 HR 의사결정을 사람, 스킬, 프로젝트의 연결 구조로 보자는 다중 도메인 매트릭스 논문을 읽었다.
AI가 코드를 빨리 쓰면, 리뷰는 어디서 막히는가
기업의 AI 코딩 도구 의무 도입이 실제 개발 흐름에서 무엇을 바꾸는지, 802명 개발자와 19만 건 이상의 PR 데이터를 추적한 논문을 읽었다.
에이전트가 일을 끝냈어도, 제대로 배운 것은 아닐 수 있다
LLM 에이전트의 스킬 사용을 최종 성공 여부만으로 평가하지 말고, 선택·준수·조합·성찰 과정을 나눠 보자는 SkillCoach 논문을 읽었다.
교육 AI는 ‘도와줄 학생’보다 ‘건드리지 않을 학생’을 먼저 배워야 한다
학습분석 기반 교육 상담에서 제로샷 LLM과 RAG가 불필요한 개입을 과잉 추천할 수 있음을 보인 논문을 HRD·평가 자동화 관점에서 읽었다.
AI 협업의 차이는 모델보다 사람의 태도에서 갈린다
예측 과제에서 인간-AI 협업의 평균 효과보다 더 중요했던 것은 관점수용, 지적 겸손, 호기심 같은 협업 역량이었다는 파일럿 연구를 읽었다.
에이전트의 기억은 쌓는 것보다 옮겨 쓰는 법이 어렵다
반복 업무를 수행하는 LLM 에이전트에서 절차적 기억이 언제 일반화되고 언제 특정 역할에 과적합되는지 평가한 AFTER 벤치마크 논문을 읽었다.
AI 교육은 사용법보다 신뢰를 설계해야 한다
생성형 AI 시대의 직무교육은 도구 사용법 전달이 아니라 직원이 자기 경험 위에서 AI를 신뢰하고 검토하며 쓸 수 있게 만드는 변화관리라는 논문을 읽었다.
AI를 쓰는 판단은 결국 사람의 눈에서 갈린다
AI가 디자인 업무에 들어올 때 실제 책임은 도구가 아니라 결과물을 판단하고 조직 안에서 통과시키는 사람의 보이지 않는 노동에 남는다는 연구를 읽었다.
에이전트가 일을 못 끝내는 이유는 지능보다 대화 구조에 있다
코딩 에이전트를 한 번에 완성하는 도구가 아니라, 모호한 요구를 사용자와 함께 발견하고 고쳐가는 협업자로 평가해야 한다는 논문을 읽었다.
기억하는 에이전트에게는 ‘무시할 줄 아는 능력’이 필요하다
장기 기억을 가진 AI 에이전트가 사용자의 과거 말에 과도하게 맞춰 사실성과 판단을 잃는 문제를 다룬 벤치마크 논문을 읽었다.
평가표는 점수가 아니라 사람이 놓칠 장면을 붙잡아야 한다
멀티모달 모델 평가를 사람의 지각에 가까운 세부 루브릭으로 다시 설계하려는 논문을 HRD·평가 자동화 관점에서 읽었다.
표를 읽는 AI는 정답보다 근거 위치를 먼저 틀린다
LLM이 표 구조를 이해해도 실제 값의 위치를 잘못 인용하거나 빠뜨리는 데이터 참조 오류를 분석한 논문을 데이터·평가 자동화 관점에서 읽었다.
AI에게 공부시키기 전에, 무엇을 질문하게 할지 봐야 한다
문서로부터 질문-답변 데이터를 스스로 만들게 하는 학습 방식이 어떤 편향과 프롬프트 인젝션 취약성을 갖는지 살핀 논문을 HRD와 지식관리 관점에서 읽었다.
규정은 프롬프트가 아니라 실행 가능한 기준이어야 한다
조직 정책을 LLM에게 한 번에 판단시키지 않고, 추출 질문과 규칙 엔진으로 나누어 문서 검토를 더 점검 가능하게 만드는 PolicyGuard 논문을 Deciflow 관점에서 읽었다.
복잡한 멀티에이전트가 늘 좋은 것은 아니다
README 자동 생성 실험을 통해, 단일 에이전트 RAG와 멀티에이전트 RAG, 개발자 계획 개입 방식의 품질·비용 차이를 비교한 논문을 실무 자동화 관점에서 읽었다.
AI 평가 시스템의 병목은 문항을 많이 만드는 것이 아니라 오래 건강하게 관리하는 일이다
Duolingo English Test의 AQuAP 사례를 통해, AI 기반 평가에서 문항 생성보다 더 중요한 문항 은행 건강성, 노출, 편향, 리뷰 흐름의 지속 모니터링을 읽었다.
AI 네이티브 엔지니어는 코드를 덜 쓰는 사람이 아니라 책임 경계를 설계하는 사람이다
AI 에이전트가 코드를 쓰기 시작할 때 엔지니어의 일은 구현량보다 워크플로, 평가, 개입 조건, 책임 경계를 설계하는 쪽으로 이동한다는 논문을 업무 설계 관점에서 읽었다.
RAG 메모리에서 더 위험한 것은 잊는 것이 아니라 오래된 사실을 믿는 일이다
AI 에이전트의 장기기억을 RAG 검색 문제로만 다루면, 최신 사실과 낡은 사실을 구분하지 못하는 구조적 문제가 생긴다. 시간 유효성이라는 관점에서 업무용 에이전트 메모리를 읽었다.
평가문항의 난이도는 정답률만이 아니라 풀이의 흐름에 있다
교육평가에서 문항 난이도를 텍스트 특징이나 정답률만으로 보지 않고, 추론 모델의 풀이 과정을 인지 에피소드로 나누어 해석하려는 연구를 HRD·평가 설계 관점에서 읽었다.
AI 업무의 피로는 답이 아니라 타이핑 사이에 남는다
LLM 협업의 성패를 답의 품질만으로 보지 않고, 사용자가 프롬프트를 쓰는 동안 남기는 멈춤·수정·속도 같은 신호로 업무 부담을 읽어보려는 연구를 정리했다.
GUI 에이전트는 클릭보다 과제 기억을 배워야 한다
웹 GUI 에이전트가 반복 업무를 잘하려면 원자적 클릭 기술보다 과제 수준의 계획 경험과 사후 경험 재구성이 중요하다는 PEEU 연구를 실무 자동화 관점에서 읽었다.
AI 도입은 교육보다 먼저 안전감을 요구한다
2,257명 직원 설문을 바탕으로 심리적 안전감이 AI 도입 여부와는 관련되지만, 도입 이후 사용 빈도·시간까지 설명하지는 못한다는 결과를 HRD 관점에서 읽었다.
업무 AI는 대답보다 증거 찾는 습관이 먼저다
사내 문서 더미에서 AI 에이전트가 실제로 증거를 찾고, 단위와 용어를 맞추고, 계산까지 할 수 있는지를 묻는 벤치마크 AGORA를 업무설계 관점에서 읽었다.
검색어를 만드는 AI는 보상 설계에서 무너진다
LinkedIn의 산업용 의미 검색 사례를 통해 RLAIF 기반 검색어 생성에서 보상 해킹과 규칙 기반 안전장치가 왜 중요한지 읽는다.
AI 튜터는 친절함보다 어느 순간에 도와야 하는지가 먼저다
LLM 기반 학습 에이전트를 교육 이론과 진단 전략에 맞춰 설계해야 한다는 논문을 HRD·교육평가 관점에서 읽었다.
AI 에이전트 도입은 사용률보다 위임의 깊이를 봐야 한다
Codex 사용 데이터를 통해 에이전트형 AI가 단순 질의 도구에서 위임·검토·병렬 실행의 작업 시스템으로 이동하는 조건을 읽는다.
성능을 재기 전에, 실패를 어떻게 볼지 정해야 한다
Large language models (LLMs) are increasingly being integrated into mental health support tools and other psychologically sensitive conversational applications. In such…
AI 대시보드는 답보다 판단의 화면을 바꾼다
The use of Generative AI Conversational User Interfaces (CUI) as a new way to access and analyze data is growing in all sectors, and the industrial one is no exception.…
AI 에이전트는 도구보다 실행 환경을 먼저 필요로 한다
AI agents are driving a new software paradigm, with the ability to autonomously call tools, extract information, manage memory, and complete tasks that span application…
문서 자동화의 핵심은 추출보다 판정 근거다
독일 중앙은행 담보 적격성 검토 사례를 통해, 긴 문서 업무에서 LLM 자동화가 추출-정규화-해석-검증의 운영 구조로 설계되어야 함을 읽는다.
AI 채점은 점수보다 ‘넘길 때’를 알아야 한다
학생 그림 평가 자동화 논문을 통해, 교육평가와 HRD 평가에서 AI가 점수만 내는 도구가 아니라 언제 사람에게 넘길지 판단하는 구조가 되어야 함을 읽는다.
AI 사고는 작은 설계 착각에서 시작된다
직장 AI 사고를 '성능 부족'이 아니라 노동자 필요와 개발자 설계 사이의 어긋남으로 읽어본 논문 메모.
데이터셋도 이제 에이전트가 실험한다
Autodata 논문을 통해, 합성 데이터를 한 번 생성하는 일이 아니라 검사·평가·개선 루프를 돌리는 에이전트형 데이터 과업으로 읽은 작업 메모.
좋은 AI 코치는 언제 물러날지 안다
드론 레이싱 사용자 연구를 통해, AI 코칭이 즉각적 수행보다 독립적 숙련을 목표로 할 때 무엇이 달라지는지 읽은 작업 메모.
AI 도입은 직무를 없애기보다 경계를 흐린다
SAP BTP 맥락의 인터뷰와 워크숍을 통해, AI가 기업 소프트웨어 사용자 역할을 어떻게 넓히고 겹치게 만드는지 읽은 작업 메모.
에이전트 기억은 검색창이 아니라 운영 시스템이다
에이전트 메모리를 단순 RAG가 아니라 저장·추출·검색/라우팅·유지보수 모듈을 가진 데이터 관리 시스템으로 평가해야 한다는 논문을 업무 자동화 관점에서 읽었다.
쉬운 문제와 좋은 문제는 다르다
LLM이 문항 난이도보다 더 섬세한 문항 변별도를 얼마나 읽어낼 수 있는지 실험한 연구를, 교육평가와 성과관리 지표 설계의 경고로 읽었다.
요구사항은 AI에게 맡기기 전에 사람이 같이 헷갈려야 한다
요구사항 도출에서 AI 단독 생성보다 이해관계자 협업과 AI 합성이 만났을 때 산출물 평가가 더 좋았다는 실험을, 조직의 AI 업무설계 관점에서 읽었다.
에이전트 권한은 토큰보다 의도에 먼저 묶여야 한다
AI 에이전트가 도구를 호출할 때 기존 토큰 권한만으로는 부족하다는 문제의식. 사용자의 현재 요청 의도를 서버 쪽 정책 속성으로 삼아 도구 목록과 실행 효과를 좁히는 IGAC 아이디어를 업무 자동화 관점에서 읽었다.
수업 몰입도를 AI로 재기 전에, 프롬프트 흔들림부터 봐야 한다
교실 몰입도 인식을 VLM으로 자동화할 때 개인 단위 판정은 거의 무작위에 가깝고, 프롬프트만 바뀌어도 결과가 크게 흔들릴 수 있다는 벤치마크 연구. 교육평가 자동화의 안전한 단위를 묻는다.
AI 추천이 붙으면 사람의 검토 시간도 흔들린다
AI 이력서 추천이 결과만이 아니라 사람이 누구의 이력서를 얼마나 오래 보는지까지 바꿀 수 있다는 연구. 채용·평가 AI를 도입할 때 결과 지표만 보면 놓치는 절차적 공정성의 신호를 짚는다.
업무 자동화는 문서 검색보다 절차 기억에 가깝다
GraphMind는 과거 운영 사고 해결 흔적에서 문제-행동 그래프를 만들고, 에이전트가 그 그래프를 따라 업무 절차를 실행·갱신하게 하는 연구다. RAG보다 절차 기억을 설계해야 한다는 점에서 Deciflow 자동화에 직접 연결된다.
학습자의 실수를 만들 수 있어야 평가도 빨라진다
LLM이 학생의 Java 프로그래밍 오류를 얼마나 그럴듯하게 시뮬레이션할 수 있는지 검토한 논문. HRD·교육평가 관점에서는 진짜 데이터가 쌓이기 전 평가 문항과 피드백 설계를 미리 시험하는 방법으로 읽힌다.
AI가 누구에게 더 도움이 되는지 먼저 물어야 한다
AI 보조가 모두에게 같은 생산성 향상을 주는 것이 아니라, 기본 역량과 자기 판단의 보정 정도에 따라 다르게 작동한다는 점을 방사선 판독 데이터로 다시 확인한 논문 메모.
빠른 RAG는 질문이 언제 안정되는지부터 봐야 한다
Streaming RAG가 항상 빨라지는 기술이 아니라, 사용자의 질문 의도가 입력 중 언제 안정되는지에 따라 이득이 갈린다는 분석을 실무 자동화 관점에서 읽었다.
AI 채점은 점수보다 먼저, 무엇을 읽고 있는지 물어야 한다
LLM이 에세이 품질을 내부 표현으로 어느 정도 포착한다는 분석을, 교육평가·HRD 평가 자동화에서 신뢰와 검토 기준을 세우는 문제로 읽었다.
AI를 빌려 쓴 만큼, 검증할 힘도 같이 갚아야 한다
AI가 단기 생산성을 높일수록, 사람이 직접 검증하고 재구성하는 능력이 보이지 않는 부채처럼 줄어들 수 있다는 모델을 조직 AI 도입 관점에서 읽었다.
에이전트에게 기억보다 먼저 필요한 것은 장부다
도구 호출 에이전트가 오래된 정보나 정책 위반으로 실패하지 않도록, 프롬프트 안 기억 대신 별도 상태 장부와 정책 게이트를 두는 LedgerAgent 논문을 읽었다.
교육 평가는 수료 점수가 아니라 현장 전이를 물어야 한다
튜터 교육 성과를 온라인 수업 점수에서 끝내지 않고 실제 튜터링 대화 전사로 연결한 연구를 HRD·교육평가 관점에서 읽었다.
AI 면담은 설문지가 놓치는 말의 결을 붙잡을 수 있을까
AI가 반구조화 면담을 진행하면 설문조사의 규모와 인터뷰의 깊이를 동시에 조금씩 가져올 수 있는지, 그리고 HR·조직 진단에서 무엇을 조심해야 하는지 읽었다.
에이전트 보안은 차단보다 확률의 상한을 관리하는 일이다
도구 호출 AI 에이전트의 보안 정책을 확률적 불확실성 속에서 검증하는 논문을 읽고, 업무 자동화에서 ‘위반 확률의 상한’을 관리하는 방식을 생각한다.
조기경보 모델은 ‘언제 알 수 있었나’부터 물어야 한다
학습분석 조기경보 모델에서 시간 누수(temporal leakage)를 제거해야 하는 이유를 읽는다. 성과 예측보다 먼저 예측 시점의 정보 가용성을 검증해야 한다.
AI 도입은 이사회가 아니라 직원의 자리에서 검증된다
에이전트형 AI 도입을 이사회 의무와 직원 이해관계의 문제로 다시 읽는다. 효율화 결정보다 먼저 물어야 할 것은 대체되는 일, 재교육, 참여 절차다.
AI 에이전트 UX는 예쁜 화면보다 진행 상황을 보이게 하는 일이다
기업 업무에 AI 에이전트를 넣을 때 사용자가 원하는 것은 단순한 자동화가 아니라 통제, 책임, 데이터 출처, 다음 행동이 보이는 상호작용이다. 이 논문은 비즈니스 맥락의 인간-AI 에이전트 UX 기준을 묻는다.
학습 데이터에서 큰 단어보다 작은 신호를 놓치지 않기
정량적 학습분석 도구는 학생 집단의 흐름을 빨리 보여주지만, 빈도 낮은 중요한 응답을 가릴 수도 있다. 이 논문은 교육 평가와 시각화 사이의 긴장을 현장 연구자들의 사용 경험으로 읽는다.
AI 팀워크의 병목은 사람 수가 아니라 인수인계다
공유 작업공간에서 사람과 AI 에이전트가 함께 일할 때, 더 많은 전문성이 자동으로 더 나은 결과를 만들지는 않는다. 이 논문은 협업 구조와 책임 신호가 성과를 어떻게 바꾸는지 묻는다.
에이전트에게 일을 맡기려면 흔적부터 보여야 한다
과학 연구 에이전트의 실행 과정을 그래프로 기록·시각화하는 연구를 읽고, 업무 자동화에서 최종 산출물보다 중간 흔적을 설계해야 하는 이유를 정리한다.
평가는 한 대의 카메라로 사람을 단정하지 않는다
숙련도 평가는 무엇을 보느냐에 따라 달라진다. 다중 시점 비디오 기반 숙련도 추정 연구를 HRD와 현장 평가 설계 관점에서 읽어본다.
AI 도입은 도구 전환이 아니라 신뢰 전환이다
HR 지식검색 전환 사례를 바탕으로, 생성형 AI 도입이 왜 시스템 교체가 아니라 역할·검증 습관·조직 신뢰를 다시 설계하는 문제인지 정리한다.
딥리서치 에이전트는 질문보다 평가 기준을 먼저 지어야 할 때가 있다
딥리서치 에이전트를 업무에 쓰려면 좋은 질문보다 먼저 좋은 평가 기준과 증거 구조가 필요하다. 루브릭 기반 자동화 설계를 논문으로 읽는다.
교육 데이터는 정확도보다 먼저, 결정에 써도 되는지 물어야 한다
학생 중도탈락 지원에 쓰는 합성·증류 데이터가 예측 성능만으로 충분하지 않다는 점을 다룬 논문이다. HRD와 교육평가에서도 모델의 정확도보다 결정용 근거가 보존되는지 먼저 확인해야 한다.
AI와 협업한다고 말하기 전에, 역할부터 다시 봐야 한다
인간-AI 협업이라는 말을 실제 협업으로 부르려면 무엇이 필요한지 따져보는 논문이다. 업무 AI 도입에서도 ‘협업’이라는 좋은 말보다 상담, 위임, 지시, 공동 추론의 차이를 먼저 구분해야 한다.
AI 에이전트의 위험은 실패보다 그럴듯한 보고서다
운영 중인 LLM 에이전트에서 조용한 실패가 어떻게 그럴듯한 이야기로 바뀌는지 추적한 사례 연구다. 자동화 운영에서 필요한 것은 더 많은 테스트만이 아니라 사람이 볼 수 있는 실패 신호다.
협업 역량은 참여 횟수가 아니라 대화의 구조에서 보인다
협업 대화를 개념 지도와 평가 기준으로 바꾸는 연구를 바탕으로, HRD와 교육평가에서 협업역량을 어떻게 진단할 수 있는지 정리한다.
동료가 된 AI에게는 작업장이 필요하다
AI가 챗봇에서 디지털 동료로 넘어가려면 기억, 작업공간, 검증 루프, 권한 위임이 함께 필요하다. 인간-AI 협업을 업무설계 관점에서 읽는다.
RAG 문서가 많아질수록 먼저 좁혀야 한다
문서가 많아질수록 RAG 검색 품질이 오히려 희석될 수 있다는 연구를 바탕으로, 업무 지식관리와 검색 설계에서 먼저 좁혀야 할 기준을 정리한다.
채용 AI에서 중요한 것은 점수가 아니라 판단의 흔적이다
LLM 에이전트로 후보자 평가와 순위를 만드는 연구를 채용 자동화가 아니라 평가 기준, 설명 가능성, 인간 검토 구조의 문제로 읽었다.
AI 동료와 일할수록 코딩보다 검증이 일이 된다
생성형 AI와 에이전트가 소프트웨어 일을 코드 작성량이 아니라 의도 지정, 검증, 통제, 책임의 문제로 바꾸고 있음을 업무설계 관점에서 읽는다.
에이전트 메모리는 검색보다 실행 상태를 지키는 일에 가깝다
장기 과제를 수행하는 AI 에이전트에게 메모리는 유사도 검색이 아니라 실행 상태 관리라는 관점의 논문 메모.
교육평가는 점수보다 학습 장면을 먼저 그려야 한다
전문가 학습을 메타인지, 피드백, 업무 맥락의 조합으로 나누어 보는 HRD·교육평가 메모.
AI가 너무 유능할 때, 일의 주인은 흐려질 수 있다
인간-AI 협업을 성과가 아니라 소유감, 의미감, 동료의 시선으로 다시 읽어본 논문 메모.
협업 AI는 똑똑한 답보다 설명 가능한 행동 규칙이 필요하다
LLM 추론을 실행 가능한 정책 트리로 증류해 인간-AI 협업의 해석 가능성과 속도를 함께 얻으려는 Co-π-tree 논문을 Deciflow 자동화 관점에서 읽은 노트.
성과관리는 속도보다 팀의 리듬과 안전감을 봐야 한다
남아프리카 IT 인력 17명 인터뷰를 바탕으로, 애자일 실천이 직원 성과에 미치는 영향을 팀 역동, 커뮤니케이션, 자율성, 학습, 웰빙 관점에서 읽은 성과관리 노트.
AI 도입은 정책보다 먼저 동료의 압력으로 퍼질 수 있다
방글라데시 기자 23명 인터뷰를 바탕으로, 공식 정책과 교육이 거의 없는 상황에서도 GenAI 사용이 동료 압력과 직업적 필요로 확산되는 과정을 UTAUT 관점에서 읽은 논문 메모.
AI 도입의 병목은 나이보다 권한과 불안에 있다
2,257명의 전문직 설문을 바탕으로, 직장 내 AI 채택을 직급·경험·지역·불안·자기효능감으로 다시 읽은 논문 메모. AI 전환의 핵심은 교육만이 아니라 권한과 심리적 안전감을 설계하는 일이다.
AI 동료와 일하면, 사람은 더 많이 만들지만 더 비슷해진다
AI 에이전트와 협업한 팀은 생산량과 텍스트 품질을 높였지만, 이미지 품질과 산출물 다양성에서는 다른 경계가 드러났다. 이 논문은 AI 도입보다 먼저 협업 구조를 설계해야 한다는 질문을 남긴다.