Team Ai
Apppublic

fawadrashid/Object_Detection_With_Audio

sourceHugging Faceapache-2.0updated 3y agoView on Hugging Face
0likes
app.py50 linesDownload Raw Back to root
1import os2from PIL import Image, ImageDraw, ImageFont3import gradio as gr4from helper import load_image_from_url, render_results_in_image 5from helper import summarize_predictions_natural_language6from transformers import pipeline7from transformers.utils import logging8logging.set_verbosity_error()9 10from helper import ignore_warnings11ignore_warnings()12 13 14 15 16od_pipe = pipeline("object-detection", "facebook/detr-resnet-50")17tts_pipe = pipeline("text-to-speech",18                    model="kakao-enterprise/vits-ljs")19 20 21def get_pipeline_prediction(pil_image):22    23    pipeline_output = od_pipe(pil_image)24    25    processed_image = render_results_in_image(pil_image,26                                            pipeline_output)27    28    text = summarize_predictions_natural_language(pipeline_output)29    print(text)30    narrated_text = tts_pipe(text)31 32    #print (narrated_text)33    print(narrated_text["audio"][0])34    print (narrated_text["sampling_rate"])35    return processed_image, (narrated_text["sampling_rate"], narrated_text["audio"][0] )36    #return processed_image37 38 39demo = gr.Interface(40  fn=get_pipeline_prediction,41  inputs=gr.Image(label="Input image", 42                  type="pil"),43  outputs=[gr.Image(label="Output image with predicted instances",44                   type="pil"), gr.Audio(label="Narration", type="numpy",  autoplay=True)]45  #outputs=gr.Image(label="Output image with predicted instances",46  #                 type="pil")47)48 49demo.launch(server_name="0.0.0.0", server_port=7860)50