Memes, as dominant vehicles of online discourse, often embed biases ranging from explicit hate to subtle sarcasm through intertwined visual and textual elements, escaping unimodal detection systems and amplified by severe class imbalance. This study introduces a multimodal deep learning framework for meme bias classification on the MemeBias-5 dataset, integrating dual CNN backbones (ResNet50 and EfficientNetB0) to extract hierarchical visual representations with a BiLSTM encoder capturing contextual textual semantics. An adaptive attentionbased fusion mechanism dynamically weighs modality contributions, resolving cross-modal perceptual gaps. A dual-balanced preprocessing pipeline employing MixUp augmentation addresses imbalance and enhances generalization. Trained end-to-end with Adam optimization and categorical cross-entropy, the framework attains 81.07% accuracy and 80.60% macro-F1, outperforming unimodal ResNet50 by 19 % and baseline fusion by 5 %, with per-class F1 gains up to 18.5% for Sarcastic samples. Attention visualizations further expose ironic interplay, positioning this framework as an interpretable moderation solution for biasaware social moderation and future multilingual extensions.