fawadrashid/Object_Detection_With_Audio
0
1import os2from PIL import Image, ImageDraw, ImageFont3import gradio as gr4from helper import load_image_from_url, render_results_in_image 5from helper import summarize_predictions_natural_language6from transformers import pipeline7from transformers.utils import logging8logging.set_verbosity_error()9 10from helper import ignore_warnings11ignore_warnings()12 13 14 15 16od_pipe = pipeline("object-detection", "facebook/detr-resnet-50")17tts_pipe = pipeline("text-to-speech",18 model="kakao-enterprise/vits-ljs")19 20 21def get_pipeline_prediction(pil_image):22 23 pipeline_output = od_pipe(pil_image)24 25 processed_image = render_results_in_image(pil_image,26 pipeline_output)27 28 text = summarize_predictions_natural_language(pipeline_output)29 print(text)30 narrated_text = tts_pipe(text)31 32 #print (narrated_text)33 print(narrated_text["audio"][0])34 print (narrated_text["sampling_rate"])35 return processed_image, (narrated_text["sampling_rate"], narrated_text["audio"][0] )36 #return processed_image37 38 39demo = gr.Interface(40 fn=get_pipeline_prediction,41 inputs=gr.Image(label="Input image", 42 type="pil"),43 outputs=[gr.Image(label="Output image with predicted instances",44 type="pil"), gr.Audio(label="Narration", type="numpy", autoplay=True)]45 #outputs=gr.Image(label="Output image with predicted instances",46 # type="pil")47)48 49demo.launch(server_name="0.0.0.0", server_port=7860)50 