Tuyến Trần, MD
AI cho nghiên cứu

Elicit, Consensus hay SciSpace: ba công cụ tìm khoảng trống nghiên cứu, ba kết quả khác nhau

Cùng một câu hỏi về khoảng trống nghiên cứu, ba công cụ AI cho ba góc nhìn khác hẳn nhau. Đây là cách mình đọc từng kết quả và tổng hợp lại để xác định khoảng trống thật sự đang mở, minh họa bằng đề tài phẫu thuật hypospadias nặng.

Tìm khoảng trống nghiên cứu trước khi thiết kế nghiên cứu

Trước khi thiết kế một nghiên cứu, câu hỏi đầu tiên phải trả lời được: khoảng trống nào trong y văn hiện tại còn đang mở? Trả lời sai bước này thì cả đề tài lệch hướng.

Lấy một ví dụ trong chuyên ngành của mình, phẫu thuật hypospadias nặng ở trẻ em. Câu hỏi nghe đơn giản: với hypospadias mức độ nặng, còn khoảng trống nào chưa được trả lời? Thay vì mở PubMed và tìm kiếm từ đầu, việc có thể mất cả ngày, mình thử ba công cụ AI song song: Elicit, Consensus, SciSpace. Cùng một câu truy vấn, ba kết quả khác nhau hẳn.

Elicit, xác định khoảng trống về phương pháp

Câu truy vấn mình dùng cho cả ba: "research gaps in severe hypospadias surgical outcomes"

Elicit trả về theo hướng phương pháp luận. Công cụ này tự động trích xuất thông tin từ từng paper, thiết kế nghiên cứu, chỉ số đánh giá kết quả, cỡ mẫu, và từ đó hiện rõ một khuôn mẫu chung: phần lớn nghiên cứu hypospadias nặng thiếu chỉ số đánh giá kết quả chuẩn hóa thống nhất. Mỗi trung tâm báo cáo tỷ lệ rò, co rút miệng sáo, kết quả thẩm mỹ theo tiêu chí riêng. So sánh giữa các nghiên cứu gần như không thể.

Khoảng trống Elicit gợi ý: cần nghiên cứu với thang điểm đã được kiểm định nhất quán để so sánh kết quả. Đây không phải là thiếu dữ liệu, là thiếu dữ liệu có thể so sánh với nhau.

Điểm mạnh của Elicit: rất tốt để trích xuất chi tiết phương pháp từ paper. Nếu muốn xem nhanh "10 paper này dùng chỉ số đánh giá kết quả gì," Elicit làm tốt hơn Consensus hay SciSpace.

Consensus, xác định khoảng trống về bằng chứng so sánh

Consensus trả lời theo kiểu khác hẳn. Công cụ này tổng hợp mức đồng thuận từ y văn theo đúng nghĩa đen, nó hỏi các paper và cho ra câu trả lời tổng hợp.

Câu truy vấn của mình ra kết quả tập trung vào so sánh kỹ thuật. Điểm Consensus chỉ ra: chưa có so sánh trực tiếp đủ cỡ mẫu khi phân tầng theo mức độ nặng riêng biệt. Phần lớn nghiên cứu gộp chung tất cả ca nặng vào một nhóm mà không phân theo độ nặng.

Consensus mạnh nhất khi cần câu hỏi so sánh kiểu "kỹ thuật A so với B tốt hơn ở điểm nào." Với câu hỏi mở như "khoảng trống là gì," kết quả ít sâu hơn Elicit về phương pháp nhưng rõ hơn về mức độ liên quan lâm sàng.

SciSpace, xác định bức tranh trích dẫn

SciSpace cho thấy mạng lưới trích dẫn thay vì tổng hợp câu trả lời. Với câu truy vấn trên, mình thấy một nhóm paper về đường cong học tập cho kỹ thuật phẫu thuật phức tạp, nhưng gần như không có paper nào dùng phương pháp CUSUM để định lượng điểm chuyển của kỹ thuật cụ thể.

Khoảng trống SciSpace gợi ý: phân tích đường cong học tập bằng CUSUM còn ít được công bố cho nhóm kỹ thuật này.

SciSpace hữu ích nhất ở bước hiểu cấu trúc lĩnh vực: ai trích dẫn ai, paper nào là nền tảng, nhóm nào đang hoạt động sôi nổi, nhóm nào đã bão hòa. Thông tin này khó thấy khi tìm kiếm PubMed thông thường.

Tổng hợp ba góc nhìn

Ba công cụ cho ba lớp khác nhau của cùng một bức tranh khoảng trống:

  • Elicit → khoảng trống về phương pháp và chuẩn hóa đo lường
  • Consensus → khoảng trống về bằng chứng so sánh theo phân tầng cụ thể
  • SciSpace → khoảng trống về kỹ thuật chuyên biệt và đường cong học tập

Không công cụ nào "đúng hơn" công cụ nào. Mỗi cái hé lộ một góc mà hai cái kia bỏ sót. Trong quy trình của mình, bước này mất khoảng 1, 2 tiếng và cho ra danh sách 15, 20 paper ưu tiên để đọc sâu. Tiết kiệm đáng kể so với bắt đầu từ con số không trong PubMed.

Sau bước AI, mình vẫn ngồi đọc paper thật để kiểm chứng: khoảng trống có còn mở không, hay đã có ai lấp rồi mà công cụ chưa biết do paper quá mới hoặc chưa được đưa vào cơ sở dữ liệu đầy đủ. AI là bước định hướng, không phải bước kết luận.

Giới hạn thực tế cần nhớ

Ba công cụ này chỉ bao phủ y văn đã công bố và được đưa vào cơ sở dữ liệu tốt, chủ yếu tiếng Anh, trên các cơ sở dữ liệu lớn như PubMed, Semantic Scholar. Paper tiếng Việt, Trung, hoặc các loạt ca lâm sàng chưa công bố từ các trung tâm lớn trong nước đều gần như vô hình với AI.

Với đề tài phẫu thuật nhi ở các nước thu nhập trung bình như Việt Nam, đây không phải vấn đề nhỏ. Kinh nghiệm lâm sàng chưa công bố ở các bệnh viện lớn trong nước có khi nhiều hơn tổng cộng những gì AI kéo được. Phần này vẫn cần hỏi trực tiếp đồng nghiệp.

Một giới hạn nữa: ba công cụ đều có thể bỏ sót paper mới công bố trong 2, 3 tháng gần đây nếu chưa được đưa vào cơ sở dữ liệu đầy đủ. Với tìm kiếm hệ thống thật, bước tìm tay và kiểm tra trích dẫn xuôi vẫn cần thiết.

Dùng AI cho khoảng trống nghiên cứu, bước đầu, không phải bước cuối

Cách mình dùng ba công cụ này không phải để tìm khoảng trống thay mình, mà để giảm thời gian định hướng trước khi đọc y văn thật. Khác biệt không lớn về chất lượng kết luận, nhưng lớn về thời gian đầu tư. Sau khoảng 2 tiếng thử công cụ, mình có đủ hướng đi để bắt đầu đọc có chủ đích, không còn cảm giác mở PubMed mà không biết bắt đầu từ đâu.

Nếu muốn xem quy trình từ khoảng trống nghiên cứu đến khi nộp paper với AI, bài 10 bước viết paper với AI có đủ lộ trình. Cũng có thể tham khảo 5 prompt Claude mình dùng hằng ngày khi đọc paper để xem cách tích hợp AI vào việc đọc và tổng hợp y văn.

Muốn học cách dùng AI cho toàn bộ quy trình nghiên cứu, từ tìm khoảng trống đến submit? Ứng dụng AI trong NCKH, quy trình thực tế có ví dụ thật từ paper thật, không phải lý thuyết.