Team Ai
Apppublic

fadimerbay/multimodal-security-analysis

sourceHugging Facemitupdated 10mo agoView on Hugging Face
0likes
App README

๐Ÿ”’ Multimodal Security Analysis System

Context-Aware Multimodal Fusion for Intelligent Threat Detection

This project implements a multimodal security threat assessment system combining:

  • โ€”๐Ÿ–ผ๏ธ Visual Analysis (YOLOv8n object detection)
  • โ€”๐Ÿ”Š Audio Analysis (Whisper speech recognition)
  • โ€”๐ŸŽฅ Temporal Analysis (Video motion tracking)
  • โ€”๐Ÿง  LLM Reasoning (Ollama/Rule-based fusion)

๐Ÿš€ Features

  • โ€”Real-time multimodal analysis
  • โ€”Frame-by-frame video processing
  • โ€”Cross-modal threat correlation
  • โ€”Confidence-based threat scoring
  • โ€”Streamlit web interface

๐Ÿ“Š Architecture

Image/Video + Audio โ†’ Encoders โ†’ Multimodal Fusion โ†’ LLM Reasoning โ†’ Threat Assessment

๐ŸŽ“ Academic Context

Master's Thesis Project (2025) Topic: Multimodal Large Language Models for Security Applications

โš™๏ธ Models Used

  • โ€”YOLO: yolov8n (11MB) - Object detection
  • โ€”Whisper: base (142MB) - Speech recognition
  • โ€”LLM: Ollama (local) / Rule-based reasoning

๐Ÿ“ Note

This deployment uses Rule-based reasoning due to Hugging Face resource constraints. Full LLM-based reasoning (Ollama) is available for local deployment.

๐Ÿ”— Links