Tuyến Trần, MD
AI cho nghiên cứu

10 bước viết paper với AI, từ idea đến submission

Quy trình 10 bước mình xây khi viết một bài nghiên cứu về AI, từ lúc chưa có research question đến lúc submit IJMI. Mỗi bước có 1 tool cụ thể và 1 lỗi mình đã mắc.

AI viết paper khoa học, quy trình thật, không phải lý thuyết

Hầu hết bài viết về AI và nghiên cứu khoa học đều dừng ở mức "dùng ChatGPT để brainstorm ý tưởng". Mình đã đọc nhiều bài kiểu đó và thấy thiếu phần quan trọng nhất: quy trình cụ thể, từng bước, ai làm gì, dùng công cụ nào, và sai ở đâu.

Bài này là quy trình mình thực sự dùng khi viết một nghiên cứu của mình về AI drift, đánh giá 1.800 abstract do ba LLM tạo ra, với rater agreement κ = 0.795, preregistered tại OSF. Từ bước hình thành research question đến lúc submit, mỗi bước mình ghi lại công cụ cụ thể đã dùng và lỗi đã mắc.

Không phải mọi bước đều dùng AI. Một số bước AI không được phép vào. Phân biệt được ranh giới đó quan trọng hơn biết dùng prompt hay.


Bước 1, Research question: AI gợi ý, mình quyết định

Công cụ: Claude (conversation mode, không có file), PubMed thủ công.

Bắt đầu bằng một câu hỏi lâm sàng mơ hồ, "LLM có đáng tin khi tóm tắt bằng chứng y khoa không?" Mình không cho Claude trả lời ngay. Mình hỏi Claude: "Paper trong lĩnh vực này đang thiếu cái gì nhất?"

Câu trả lời không phải là một khoảng trống cụ thể, mà là danh sách 5, 7 hướng tiếp cận chưa được kiểm chứng. Mình tự kiểm tra từng hướng trên PubMed. Hướng nào đã có 3+ paper thì bỏ. Còn lại 2 hướng, mình chọn 1 dựa trên khả năng thực thi.

Lỗi mình đã mắc: Tin ngay vào khoảng trống nghiên cứu Claude đề xuất mà không tự kiểm tra lại trên PubMed. Kết quả mất 2 tuần mới phát hiện hướng đó đã có RCT từ 2023.


Bước 2, Preregistration: viết trước khi thu thập dữ liệu

Công cụ: OSF, không có AI ở bước này.

Preregistration bắt buộc mình phải viết rõ hypothesis và analysis plan trước khi chạy bất kỳ dòng code nào. Đây là bước AI không nên tham gia nhiều, nếu AI giúp viết hypothesis, ranh giới giữa confirmatory và exploratory sẽ mờ.

Mình viết file OSF bằng tay, Claude chỉ review grammar và logic sau khi đã hoàn thiện nội dung.

Lỗi mình đã mắc: Cho Claude đề xuất analysis plan trước. Nhận ra sau đó plan đó lệch về hướng kết quả mình muốn thấy. Viết lại từ đầu, đặt giả thuyết lên trước phần phân tích.


Bước 3, Literature review: AI tăng tốc, không thay thế đọc

Công cụ: Elicit (abstract screening), SciSpace (full-text Q&A), Zotero (quản lý refs).

Elicit giúp mình rà nhanh khoảng 200 abstract trong 2 tiếng. Mình chọn 40 bài liên quan nhất để đọc kỹ. SciSpace giúp hỏi từng paper: "Methodology là gì?", "Kết quả chính?", "Giới hạn họ tự thừa nhận là gì?"

Nhưng với những paper cốt lõi bắt buộc đọc toàn văn, mình đọc tay. Không giao việc này cho AI.

Về quy trình AI cho bác sĩ nghiên cứu nói chung, mình đã viết một bài tổng quan trước đây về quy trình AI từ đọc paper đến viết Discussion, bài này đi sâu vào phần viết.

Lỗi mình đã mắc: Tin vào citation AI xuất ra mà không kiểm tra lại. Elicit lúc đó pull về 2 paper có PMID sai. Check thủ công là bắt buộc.


Bước 4, Study design: vẽ tay, Claude review

Công cụ: Bút và giấy để phác thảo, Claude đóng vai phản biện.

Mình vẽ sơ đồ study design tay trước: factorial design 3 model × 12 topic, 30 abstracts/topic. Sau đó dán lên Claude: "Tìm lỗ hổng trong thiết kế này, độ giá trị nội tại, yếu tố gây nhiễu, bỏ sót gì?"

Claude chỉ ra 3 điểm yếu thật, 2 điểm yếu không liên quan. Mình xử lý 3 điểm thật, bỏ qua 2 điểm còn lại.

Lỗi mình đã mắc: Không yêu cầu Claude phản biện ngay từ đầu, mà chờ đến sau khi thu thập dữ liệu mới hỏi. Quá muộn để thay design.


Bước 5, Thu thập dữ liệu: không có AI

Công cụ: Script Python tự viết, ghi log thủ công vào Excel.

Bước này AI không nên tham gia vào việc thực thi. AI có thể viết script giúp, nhưng logic thu thập dữ liệu, quyết định đưa vào hay loại ra, xử lý trường hợp đặc biệt, mình tự làm.

Trong nghiên cứu đó, mình thu thập 1.800 abstract do AI tạo ra và 120 abstract đối chứng do người viết. Script Python chạy tự động, nhưng mình tự kiểm tra tay 10% kết quả mỗi đợt.

Lỗi mình đã mắc: Tin tưởng script hoàn toàn ở đợt đầu. Phát hiện sau đó có 12 dòng bị trùng lặp do lỗi logic trong vòng lặp. Phải thu thập lại đợt đó.


Bước 6, Analysis: AI giải thích, không quyết định

Công cụ: Python (pandas, scipy, statsmodels), Claude để gỡ lỗi code và diễn giải kết quả.

Khi chạy phân tích, mình thường dán kết quả vào Claude: "Kết quả này có nghĩa gì? Cách diễn giải này có vấn đề gì không?" Claude giúp bắt lỗi logic, gợi ý cách trực quan hóa phù hợp.

Nhưng quyết định về phương pháp, chọn Cohen's κ thay vì Spearman, chọn entropy làm thước đo, mình quyết định dựa trên y văn, không phải AI gợi ý.

Lỗi mình đã mắc: Claude một lần đề xuất dùng hệ số tương quan Pearson cho dữ liệu thứ bậc. Mình tin và dùng. Reviewer phát hiện ngay. Phải chạy lại toàn bộ với Spearman. Bài học: AI gợi ý phương pháp cần verify với sách thống kê sinh học.


Bước 7, Viết Introduction: mẫu 5 đoạn, AI viết bản nháp đầu

Công cụ: Claude (với chỉ dẫn cụ thể), mình chỉnh sửa 2 lần.

Introduction mình theo mẫu 5 đoạn: (1) bối cảnh rộng, (2) khoảng trống cụ thể, (3) cách tiếp cận hiện tại và hạn chế của nó, (4) mục tiêu nghiên cứu, (5) đóng góp. Mình đưa dàn ý 5 đoạn cùng 3 tài liệu tham khảo chính cho Claude viết bản nháp đầu tiên.

Bản nháp đầu tiên thường đạt được 60, 70% cấu trúc cần có. Mình chỉnh lần 1 về nội dung, lần 2 về giọng văn.

Lỗi mình đã mắc: Để Claude viết mà không có cấu trúc rõ ràng trước. Kết quả bản nháp chung chung, phải viết lại gần như toàn bộ. Đưa cấu trúc trước khi yêu cầu Claude viết tiết kiệm thời gian hơn nhiều.


Bước 8, Viết Methods và Results: chính xác từng chữ

Công cụ: Claude cho khung mẫu, mình tự điền tất cả số liệu.

Methods là phần mình không tin tưởng AI điền số. Claude giúp viết khung mẫu, cấu trúc câu sườn. Mình tự điền từng con số, từng định nghĩa, từng tiêu chí.

Results tương tự, mình viết tay từ kết quả phân tích. Claude chỉ giúp viết lại câu cho rõ ràng, không được suy diễn từ số.

Có 5 prompt cụ thể mình dùng hằng ngày khi đọc và viết paper, mình đã tổng hợp trong bài 5 prompt Claude mình dùng hằng ngày.

Lỗi mình đã mắc: Cho Claude tự điền một đoạn Methods với dữ liệu mình tóm tắt bằng lời. Claude suy diễn số liệu sai. Reviewer chỉ ra ngay sự không khớp với Table 1.


Bước 9, Viết Discussion: AI đào sâu, mình soát lại

Công cụ: Claude (đóng vai phản biện, tạo phản luận), danh sách soát tay.

Discussion là phần AI có ích nhất trong tất cả. Mình viết paragraph chính trước, sau đó hỏi Claude:

  • "Nhận định này có được Results ủng hộ không?"
  • "Reviewer sẽ công kích điểm nào đầu tiên?"
  • "Tài liệu nào mâu thuẫn với nhận định này?"

Claude đưa ra 3, 5 phản luận mỗi lần. Mình xem xét từng cái, cái nào hợp lý thì sửa lại nhận định, cái nào không thì viết trước phần hạn chế để phòng ngừa.

Lỗi mình đã mắc: Tin Claude khi nó nói "nhận định này được [paper] hỗ trợ" mà không kiểm tra paper đó thật sự nói gì. Một lần Claude bịa ra một trích dẫn hỗ trợ không có thật. Soát lại từng nhận định trước khi nộp bài là bắt buộc.


Bước 10, Soát trước khi nộp bài: đọc lại từ đầu và AI quét

Công cụ: Claude (yêu cầu soát có cấu trúc), Grammarly (kiểm tra ngữ pháp tiếng Anh), mình đọc tay lần cuối.

Trước khi submit, mình chạy 4 vòng:

Vòng 1, Kiểm tra tính nhất quán: Dán từng phần vào Claude, hỏi "Có số liệu nào không khớp giữa Abstract, Methods, Results, Tables không?"

Vòng 2, Kiểm tra trích dẫn: Kiểm tra tay 20% trích dẫn, PMID, tác giả, năm. Không tin AI tự kiểm tra trích dẫn.

Vòng 3, Soát độ chắc chắn của nhận định: Hỏi Claude "Nhận định nào trong Discussion đang vượt quá dữ liệu?" Claude thường tìm được 2, 3 chỗ thật sự đáng lưu ý.

Vòng 4, Đọc lại từ đầu: Mình đọc toàn bài như một reviewer chưa biết bối cảnh. Ghi chú những chỗ cảm thấy "không chắc". Sửa hết trước khi submit.


Checklist trước khi nộp bài (mình dùng cho mỗi paper)

  • Câu hỏi nghiên cứu đã tự kiểm tra lại trên PubMed, không tin AI về khoảng trống nghiên cứu
  • Preregistration nộp trước khi thu thập dữ liệu
  • 100% citations đã tự kiểm tra PMID/DOI thủ công (ít nhất kiểm tra tay 20%)
  • Phần Methods: không có số nào AI điền, mình tự điền tất cả
  • Phần Results: không có số suy diễn, chỉ lấy từ kết quả phân tích
  • Các nhận định trong Discussion: mỗi nhận định chính đã đối chiếu với Results
  • Abstract khớp với toàn bài, kiểm tra số liệu từng mục
  • Cover letter: không nêu tình trạng chưa được xác nhận

Tại sao quy trình này quan trọng

Cái bẫy phổ biến nhất khi dùng AI cho paper là dùng nhiều ở những chỗ nguy hiểm nhất, methodology và các nhận định, và dùng ít ở những chỗ AI thật sự giúp được, viết bản nháp, gỡ lỗi, phản luận.

Trong nghiên cứu đó, AI giúp rút ngắn được khoảng 40% thời gian tổng. Nhưng 60% còn lại, preregistration, thu thập dữ liệu, quyết định thống kê, soát lần cuối, mình không thể giao cho AI. Không phải vì sợ AI, mà vì những bước đó cần khả năng phán đoán, không cần tốc độ.

Sự phân biệt đó là thứ mình mất gần một năm mới hiểu rõ.

Muốn xây quy trình AI hoàn chỉnh cho nghiên cứu của bạn? Ứng dụng AI trong NCKH, từ literature review đến submission, hướng dẫn step-by-step cho bác sĩ nghiên cứu VN.