인기 검색

인프라 시스템 엔지니어
공고 원문
주요업무
Linux 기반 서버 운영 및 표준 이미지 관리 안정적이고 최적화된 Linux OS 표준 이미지를 설계하고 대규모 환경에 적용 OS 배포/패치 자동화 구현 Ansible, SaltStack 등 IaC(Infrastructure as Code) 도구를 활용하여 OS 및 패치 배포 프로세스를 완전 자동화 GPU/CPU 서버 운영 및 Troubleshooting: AI 연산을 위한 고성능 서버의 런타임 환경 관리 및 복잡한 하드웨어/소프트웨어 장애 분석 및 해결 모니터링 및 로그 시스템 연동/고도화 Prometheus, Grafana, ELK 등 Observability 스택을 구축하고 서버 인프라 상태를 실시간으로 시각화 및 분석 서버 장애 분석 및 HW 문제 대응 발생한 장애의 근본 원인(RCA)을 분석하고, 벤더와 협력하여 하드웨어 문제에 대응하며 재발 방지책 마련 운영 절차 문서화 및 표준화 모든 운영 지식과 프로세스를 코드 및 문서로 체계화하여 팀의 기술 부채를 줄이고 효율성을 높임 ✨성장 기회 AI 인프라 운영 시스템 설계 참여 초기부터 수백 노드 규모 인프라의 핵심 운영 시스템(OS, 배포, 모니터링) 설계 및 개선을 주도하며, 빠른 시간 안에 엔지니어링 리더십 경험 확보할 수 있습니다. GPU 클러스터 및 HPC 아키텍처 전문가 고성능 컴퓨팅(HPC) 환경에 최적화된 시스템 운영 및 튜닝 노하우를 습득하여 희소성 높은 기술 전문가로 성장할 수 있습니다. 대규모 서버 자동화 설계 경험 확보 단순 자동화를 넘어, 수천 대 서버를 관리하는 확장성 있는 자동화 프레임워크 설계에 참여하여 엔지니어링 역량 극대화할 수 있습니다.
자격요건
Linux 기반 시스템 운영 경력 3년 이상 (대규모 환경 경험 우대) Shell, Python 등 스크립팅 언어를 활용한 운영 자동화 경험 서버 하드웨어, GPU, NIC(Network Interface Card)의 기본 구조 및 동작 원리에 대한 명확한 이해 모니터링, 알림, 로그 시스템 구축 및 활용 경험
우대사항
Ansible, Terraform 등 자동화 도구를 활용한 IaC(Infrastructure as Code) 기반 운영 경험 KVM, VMware 등 가상화 환경 또는 Kubernetes 클러스터 운영 경험 Ceph 또는 기타 분산 스토리지 운영 경험 수십에서 수백 노드 규모의 서버 인프라 운영 경험
기술스택
Python, Linux
채용절차
1 서류 전형 후보자의 경력과 엘리스에서 필요로 하는 역량을 매칭하는 첫번째 단계입니다. 2 인터뷰 직무 경험에 대한 심도 있는 대화를 진행하며, 후보자가 일하는 방식과 엘리스의 문화를 비교합니다. 3 미니 프로젝트 실제로 담당하게 될 업무와 유사한 과제를 수행해 봄으로써 직무 적합성을 판단합니다. 4 평판 조회 과거에 함께 일한 동료와 매니저가 자신을 어떻게 평가하는지 공유합니다. 5 입사 조건 협의 처우와 입사일 등의 조건을 최종 협의하며, 엘리스에 합류하기 위한 마지막 단계입니다. 6 최종 합격 "Hello, New Elicer!" 엘리스에 오신 것을 진심으로 환영합니다!🎉
엘리스그룹 지원하기 전 이력서 Check
시간이 없다면 AI와 한번에 수정해보세요