Hệ thống phân tích CV hướng đến việc phát triển một hệ thống xử lý toàn diện (End-to-End) mang tên CV Parser, có khả năng tự động trích xuất các thông tin quan trọng từ tệp CV định dạng PDF. Hệ thống ứng dụng các công nghệ Trí tuệ nhân tạo (AI), bao gồm Computer Vision và Xử lý Ngôn ngữ Tự nhiên (Natural Language Processing – NLP).
Giới Thiệu
STS là công ty gia công phát triển phần mềm theo mô hình Agile có trụ sở tại Việt Nam, được thành lập vào năm 2012, với đội ngũ hơn 350 kỹ sư phần mềm cùng quy trình phát triển đã được hoàn thiện. Mỗi tháng, công ty tiếp nhận một lượng lớn hồ sơ ứng tuyển (CV), đồng nghĩa với việc phải xử lý và sàng lọc rất nhiều tài liệu.
Bên cạnh đó, khi tìm kiếm ứng viên phù hợp, chúng tôi còn tham khảo các công cụ trực tuyến hoặc những nguồn khác như LinkedIn. Theo quy trình thông thường, đội ngũ Talent Acquisition (TA) sẽ kiểm tra thủ công từng CV để thu thập thông tin, sau đó chuyển cho Tech Lead và Project Manager xem xét và phỏng vấn. Cuối cùng, hồ sơ sẽ được chuyển đến bộ phận Human Resources (HR) để tiếp tục xử lý, lập hợp đồng, cập nhật thông tin ứng viên vào hệ thống và thực hiện các công việc liên quan khác.
STS cũng sở hữu đội ngũ AI giàu kinh nghiệm trong việc phát triển các giải pháp trí tuệ nhân tạo. Đội ngũ của chúng tôi đã tham gia nhiều dự án tương tự, cung cấp các giải pháp AI giúp xử lý tập dữ liệu lớn và xây dựng những hệ thống hiệu năng cao. Từ kinh nghiệm đó, chúng tôi đã ứng dụng các công nghệ AI để phát triển CV Parser – một hệ thống End-to-End có khả năng tự động xử lý và phân tích dữ liệu từ CV.
Phương Pháp Tiếp Cận Của Chúng Tôi
Hiện nay có nhiều công cụ, thư viện và mô-đun đọc tệp PDF có thể trích xuất lớp văn bản (Text Layer) từ tệp PDF. Tuy nhiên, kết quả thu được thường chỉ là các dòng văn bản được sắp xếp theo thứ tự dòng, khiến dữ liệu trở nên rời rạc và thiếu ngữ nghĩa.
Đối với bài toán trích xuất thông tin từ CV định dạng PDF, chúng tôi phải giải quyết một số thách thức như:
- Cấu trúc của các tệp CV rất đa dạng và không tuân theo một định dạng thống nhất.
- Khó nhóm các phần thông tin có liên quan lại với nhau.
- Máy tính khó hiểu được ý nghĩa của từng đoạn văn bản.
- Cần xây dựng nhiều quy tắc để làm sạch và chuẩn hóa dữ liệu văn bản.
Tuy nhiên, các công nghệ AI hiện đại có thể giải quyết hiệu quả những thách thức trên. Vì vậy, chúng tôi đã xây dựng hệ thống CV Parser theo mô hình End-to-End, giúp tự động phân tích và trích xuất toàn bộ thông tin có ý nghĩa từ tệp PDF.
Kiến trúc của hệ thống được chia thành 3 phần chính:
- Phần 1: Hệ thống tiếp nhận tệp PDF do người dùng tải lên, làm sạch dữ liệu và chuyển đổi nội dung từ định dạng PDF sang dữ liệu hình ảnh.
- Phần 2: Ứng dụng các thuật toán Xử lý ảnh (Image Processing) và các mô hình Computer Vision để phân tích cấu trúc của CV và nhận diện bố cục tài liệu.
- Phần 3: Mỗi vùng nội dung trong tài liệu sẽ được xử lý bằng OCR kết hợp với các mô hình Xử lý Ngôn ngữ Tự nhiên (NLP) nhằm hiểu và trích xuất ý nghĩa của dữ liệu văn bản.
Cách Sử Dụng
Bước 1
Truy cập trang CV Parser tại:
https://experiment.saigontechnology.vn/cvparser
Hoặc truy cập trang chính của STS AI Research Lab tại:
https://experiment.saigontechnology.vn/
Sau đó chọn mục CV Parser và nhấn nút Try our demo.
Bước 2
Trên trang CV Parser, nhấn nút SELECT A FILE.
Bước 3
Chọn tệp CV định dạng PDF mà bạn muốn phân tích.
Bước 4
Hệ thống sẽ hiển thị toàn bộ thông tin được trích xuất từ CV như minh họa bên dưới.
Như có thể thấy, toàn bộ quy trình thu thập thông tin cần thiết từ dữ liệu CV đòi hỏi rất nhiều công sức và sẽ càng trở nên phức tạp khi phải xử lý số lượng lớn hồ sơ. Vì vậy, chúng tôi ứng dụng các giải pháp Trí tuệ nhân tạo (AI) để tự động trích xuất các thông tin quan trọng từ CV như họ tên, thông tin liên hệ, kinh nghiệm làm việc, trình độ học vấn và nhiều dữ liệu khác.
Với những thông tin này, doanh nghiệp có thể dễ dàng phân loại ứng viên, nhanh chóng xác định những hồ sơ tiềm năng nhất, đồng thời hiểu rõ hơn về năng lực của từng ứng viên.