Tóm tắt
Các mô hình học sâu độc lập thường bị hạn chế do thiên kiến quy nạp vốn có của chúng: mạng nơ-ron tích chập (CNNs) vượt trội trong việc tự động trích xuất các kết cấu, đặc trưng cục bộ nhưng thiếu nhận thức ngữ cảnh toàn cục. Vision Transformer (ViT) có thể nắm bắt các phụ thuộc tầm xa nhưng có độ phức tạp cao, cần lượng dữ liệu lớn. Bài báo này đề xuất một khung kết hợp lai tích hợp các thế mạnh khác nhau của các mô hình CNN (ResNet50, DenseNet201) và Transformer (Swin-T). Thay vì áp dụng phương pháp bỏ phiếu mềm tiêu chuẩn, trong đó tất cả các mô hình được xem xét như nhau, chúng tôi giới thiệu chiến lược bỏ phiếu mềm có trọng số dựa trên tìm kiếm lưới. Đóng góp tối ưu của mỗi mô hình cơ sở được tinh chỉnh thông qua tìm kiếm lưới toàn diện trên một tập dữ liệu xác thực, và đánh giá cuối cùng trên tập dữ liệu kiểm thử độc lập nhằm tránh rò rỉ dữ liệu. Kết quả thực nghiệm trên 2 bộ dữ liệu X-quang ngực, mỗi bộ dữ liệu gồm 4 lớp bệnh lý. Đề xuất cải tiến dựa trên bỏ phiếu mềm của chúng tôi đạt hiệu quả phân lớp tốt hơn so với các mô hình cơ sở riêng lẻ và các phương pháp học kết hợp truyền thống. Trên tập dữ liệu ChestXray-ImageDataSet, độ chính xác tăng từ 0,69% đến 2,07% so với mô hình tốt nhất DenseNet-201 và mô hình kém nhất Swin-T. Trên tập dữ liệu COVID-19, phương pháp đề xuất gia tăng từ 1,52% độ chính xác so với mô hình tốt nhất Soft Voting và 4,02% độ chính xác so với mô hình cơ sở kém nhất Swin-T với cùng một phương pháp huấn luyện.
công trình này được cấp phép theo phép Creative Commons Ghi công 4.0 Giấy phép International . p>
Bản quyền (c) 2026 Array