Plagiarism detection represents a critical task across various fields, including academic publishing,
journalism, e-commerce, and media verification. While substantial attention focuses on identifying textual
plagiarism, image plagiarism, particularly in biology and medicine, remains a significant concern. Automated
retrieval systems often surface numerous potential candidates, but a high rate of false positives – pairs
incorrectly flagged as plagiarism – necessitates highly accurate pairwise matching for verification. Manual
alterations to images, such as rotations, mirroring, conversion to grayscale, and color distortion constitute
forms of plagiarism. This work addresses the critical need for false positive rate (FPR) minimization in pairwise
image plagiarism detection through rigorous analysis of similarity scoring models. The proposed
approach employs a siamese network with three key components: a weight-shared encoder, a symmetric
fusion module with order-invariant embedding combination, and a similarity classification head. Training
employs a hybrid self-supervised strategy with plagiarism-mimicking augmentations, combining crossentropy
loss and contrastive regularization. Ablation studies evaluate encoder architectures and fusion strategies.
For comparison, identical siamese architectures utilize frozen state-of-the-art self-supervised representations
Barlow Twins and CLIP, with fusion modules and classification heads trained identically. Experimental
validation across multi-domain images demonstrates that end-to-end trained models consistently
outperform approaches using frozen state-of-the-art representations.