binarycache/voice_to_image
3
1import whisper2import gradio as gr 3import time4from pyChatGPT import ChatGPT5import warnings6 7model = whisper.load_model("base")8 9#print(model.device)10 11def transcribe(audio):12 13 # load audio and pad/trim it to fit 30 seconds14 audio = whisper.load_audio(audio)15 audio = whisper.pad_or_trim(audio)16 17 # make log-Mel spectrogram and move to the same device as the model18 mel = whisper.log_mel_spectrogram(audio).to(model.device)19 20 # detect the spoken language21 _, probs = model.detect_language(mel)22 23 # decode the audio24 options = whisper.DecodingOptions()25 result = whisper.decode(model, mel, options)26 result_text = result.text27 28 # Pass the generated text to Audio29 chatgpt_api = ChatGPT(email='bratanmol@gmail.com', password='vq3!a^iRKr')30 resp = chatgpt_api.send_message(result_text)31 out_result = resp['message']32 33 return [result_text, out_result]34 35output_1 = gr.outputs.Textbox(label="Speech to Text")36output_2 = gr.outputs.Textbox(label="ChatGPT Output")37 38 39gr.Interface(40 title = 'OpenAI Whisper and ChatGPT ASR Gradio Web UI', 41 fn=transcribe, 42 inputs=[43 gr.inputs.Audio(source="microphone", type="filepath")44 ],45 46 outputs=[47 output_1, output_248 ],49 live=True).launch(inline=False)