Team Ai
Apppublic

binarycache/voice_to_image

sourceHugging Faceupdated 4y agoView on Hugging Face
3likes
app.py49 linesDownload Raw Back to root
1import whisper2import gradio as gr 3import time4from pyChatGPT import ChatGPT5import warnings6 7model = whisper.load_model("base")8 9#print(model.device)10 11def transcribe(audio):12 13    # load audio and pad/trim it to fit 30 seconds14    audio = whisper.load_audio(audio)15    audio = whisper.pad_or_trim(audio)16 17    # make log-Mel spectrogram and move to the same device as the model18    mel = whisper.log_mel_spectrogram(audio).to(model.device)19 20    # detect the spoken language21    _, probs = model.detect_language(mel)22 23    # decode the audio24    options = whisper.DecodingOptions()25    result = whisper.decode(model, mel, options)26    result_text = result.text27 28    # Pass the generated text to Audio29    chatgpt_api = ChatGPT(email='bratanmol@gmail.com', password='vq3!a^iRKr')30    resp = chatgpt_api.send_message(result_text)31    out_result = resp['message']32 33    return [result_text, out_result]34 35output_1 = gr.outputs.Textbox(label="Speech to Text")36output_2 = gr.outputs.Textbox(label="ChatGPT Output")37 38 39gr.Interface(40    title = 'OpenAI Whisper and ChatGPT ASR Gradio Web UI', 41    fn=transcribe, 42    inputs=[43        gr.inputs.Audio(source="microphone", type="filepath")44    ],45 46    outputs=[47        output_1,  output_248    ],49    live=True).launch(inline=False)